节点统计
功能概述
| 项目 | 内容 |
|---|---|
| 适用角色 | 模型提供方、模型调用方 |
| 导航路径 | AI基础设施 > On-Prem > 监控 > 节点统计 |
| 页面路由 | /powerone/user-monitor/node |
| 管理对象 | 用户可见范围内的节点资源趋势和状态 |
新手理解
节点统计像每台服务器的仪表盘,用来观察节点 CPU、内存、GPU 和状态,判断任务慢或失败是不是落在某个节点上。
术语表
| 术语 | 说明 |
|---|---|
| 节点名 | 集群中承载实例或作业的服务器节点标识。 |
| CPU 使用率 | 节点计算资源的使用比例。 |
| 内存使用率 | 节点内存的占用比例。 |
推荐操作顺序
先确认用户可见范围内的节点资源趋势和状态的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。
小白先看
先确认当前任务是否涉及用户可见范围内的节点资源趋势和状态,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。
前提条件
- 当前账号具备节点监控查看权限。
- 运营管理员已开放目标地域或集群的节点指标。
- 节点采集数据已正常上报。
- 需要排查的实例或作业能对应到时间范围。
页面说明
页面用于查看和处理用户可见范围内的节点资源趋势和状态。

页面展示所选地域的节点统计能力。能力开放时,用户可以查看指标趋势、列表数据或关键状态;能力未开放时,页面会显示能力提示。
能力开放时页面预期
| 页面元素 | 示例 | 说明 |
|---|---|---|
| 节点列表 | node-a-01 | 展示用户可见范围内的节点。 |
| CPU 指标 | CPU 使用率 65% | 判断节点计算资源压力。 |
| 内存指标 | 128GiB / 256GiB | 判断实例是否受内存资源影响。 |
| 磁盘指标 | Disk 70% | 判断日志、缓存或数据目录是否接近上限。 |
| 节点状态 | Ready / NotReady | 判断节点是否可承载作业。 |
主要操作
查看节点统计
- 进入
AI基础设施 > On-Prem > 监控 > 节点统计。 - 确认右上角地域与时间范围,按节点状态或关键字筛选。
- 查看节点运行指标图表与列表,核对 CPU、内存及 GPU 曲线变化。
- 如监控能力未开放,可回到实例详情页查看具体日志、事件和状态。
排查节点异常指标
- 发现承载自身任务的节点状态变为 NotReady 或资源曲线持续打满时,记录节点标识与时间。
- 切换到
作业监控,核对该节点上是否有自身作业处于异常或排队状态。 - 若节点持续异常导致训练任务中断或推理延迟,联系运营管理员排查节点健康状况。
能力开放时重点查看
- 节点是否 Ready 或可调度。
- CPU、内存、GPU 曲线是否持续高位。
- 曲线是否中断或更新时间明显滞后。
参数速查表
| 字段名称 | 是否必填 | 字段类型 | 示例 | 说明 |
|---|---|---|---|---|
| 节点名 | 必填 | 文本 | node-gpu-01 | 定位具体节点。 |
| 地域 | 条件必填 | 下拉选择 | 华中一区 | 限定节点所属地域。 |
| 集群 | 条件必填 | 下拉选择 | cluster-a | 限定节点所属集群。 |
| CPU 使用率 | 系统生成 | 百分比 | 72% | 判断节点 CPU 压力。 |
| 内存使用率 | 系统生成 | 百分比 | 81% | 判断节点内存压力。 |
| GPU 使用率 | 系统生成 | 百分比 | 65% | 判断节点加速卡计算压力。 |
| 节点状态 | 系统生成 | 状态 | Ready | 展示节点是否可用或异常。 |
踩坑提示
- CPU 或内存曲线短暂升高不一定是故障,要结合任务运行窗口。
- 曲线中断可能是采集延迟,也可能是节点不可用。
- 用户侧通常不能直接维护节点,排障时应准备时间范围和实例信息给运营管理员。
排障信息准备
节点页异常时,先准备以下信息,便于判断是单节点故障、资源耗尽还是采集延迟:
| 信息 | 示例 | 作用 |
|---|---|---|
| 节点名 | node-gpu-01 | 定位具体机器。 |
| 所属集群 | cluster-prod-a | 判断节点归属和影响范围。 |
| CPU / 内存曲线 | CPU 92% / 内存 85% | 判断是否资源高水位。 |
| 磁盘曲线 | 磁盘 90% | 判断镜像拉取、日志写入和临时文件风险。 |
| 节点状态时间 | NotReady 10 分钟 | 判断异常持续时间。 |
结果校验
| 检查项 | 成功表现 | 异常时处理 |
|---|---|---|
| 页面加载 | 节点统计图表或列表正常显示 | 检查当前角色的监控权限和所选地域是否开放采集能力 |
| 统计范围 | 时间范围、地域和对象数量与排查目标一致 | 清除筛选后逐项恢复条件,确认没有混用不同统计口径 |
| 数据新鲜度 | 更新时间落在预期采集周期内 | 到系统设置或监控采集组件核对采集周期、连接和告警 |
| 异常关联 | 异常指标能关联到集群、节点、设备或作业 | 保持相同时间范围,到相邻监控页和对象详情交叉核对 |
常见问题
节点统计没有数据
问题现象:
页面可进入,但图表或列表为空。
可能原因:
- 所选时间没有任务。
- 地域未开放采集。
- 当前角色无指标权限。
处理方式:
- 扩大时间范围并重置筛选
- 核对地域监控能力
- 到相邻监控页确认是否同样无数据。
节点统计更新不及时
问题现象:
页面数据长时间没有变化。
可能原因:
- 采集周期尚未到。
- 采集组件异常。
- 页面缓存未刷新。
处理方式:
- 核对更新时间
- 检查采集组件和告警
- 刷新后用同一时间范围复查。
节点统计与相邻页面数值不一致
问题现象:
同一对象在两个监控页面显示不同数值。
可能原因:
- 聚合粒度不同。
- 时间范围或时区不同。
- 筛选对象不同。
处理方式:
- 统一时间范围和时区
- 核对聚合口径
- 清除筛选后逐项恢复。
无法在关联监控中定位目标对象
问题现象:
点击指标或详情入口后找不到对应对象。
可能原因:
- 对象已结束或被移除。
- 角色不可见。
- 关联标识不一致。
处理方式:
- 记录对象名称和时间
- 到对应列表核对状态
- 联系运营管理员检查可见范围。
异常峰值无法复现
问题现象:
监控中出现峰值,但当前详情已恢复正常。
可能原因:
- 峰值持续时间短。
- 采样粒度较粗。
- 任务已经结束。
处理方式:
- 锁定峰值时间段
- 对照作业和节点事件
- 保留脱敏截图和对象标识。
注意事项
- 节点名、IP 和标签属于运维敏感信息,截图前需脱敏。
- 节点指标仅说明资源状态,业务失败还需要结合日志和事件。
- 用户侧不能直接修复节点,应把证据交给运营管理员。
后续操作
- 节点指标异常时,查看受影响作业或实例是否集中在该节点。
- GPU 相关问题继续进入设备监控。
- 如果节点持续异常,避免在同一规格上反复重试。