Skip to content

节点统计 ​

功能概述 ​

项目内容
适用角色模型提供方、模型调用方
导航路径AI基础设施 > On-Prem > 监控 > 节点统计
页面路由/powerone/user-monitor/node
管理对象用户可见范围内的节点资源趋势和状态

新手理解 ​

节点统计像每台服务器的仪表盘,用来观察节点 CPU、内存、GPU 和状态,判断任务慢或失败是不是落在某个节点上。

术语表 ​

术语说明
节点名集群中承载实例或作业的服务器节点标识。
CPU 使用率节点计算资源的使用比例。
内存使用率节点内存的占用比例。

推荐操作顺序 ​

先确认用户可见范围内的节点资源趋势和状态的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。

小白先看 ​

先确认当前任务是否涉及用户可见范围内的节点资源趋势和状态,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。

前提条件 ​

  1. 当前账号具备节点监控查看权限。
  2. 运营管理员已开放目标地域或集群的节点指标。
  3. 节点采集数据已正常上报。
  4. 需要排查的实例或作业能对应到时间范围。

页面说明 ​

页面用于查看和处理用户可见范围内的节点资源趋势和状态。

节点统计

页面展示所选地域的节点统计能力。能力开放时,用户可以查看指标趋势、列表数据或关键状态;能力未开放时,页面会显示能力提示。

能力开放时页面预期 ​

页面元素示例说明
节点列表node-a-01展示用户可见范围内的节点。
CPU 指标CPU 使用率 65%判断节点计算资源压力。
内存指标128GiB / 256GiB判断实例是否受内存资源影响。
磁盘指标Disk 70%判断日志、缓存或数据目录是否接近上限。
节点状态Ready / NotReady判断节点是否可承载作业。

主要操作 ​

查看节点统计 ​

  1. 进入 AI基础设施 > On-Prem > 监控 > 节点统计。
  2. 确认右上角地域与时间范围,按节点状态或关键字筛选。
  3. 查看节点运行指标图表与列表,核对 CPU、内存及 GPU 曲线变化。
  4. 如监控能力未开放,可回到实例详情页查看具体日志、事件和状态。

排查节点异常指标 ​

  1. 发现承载自身任务的节点状态变为 NotReady 或资源曲线持续打满时,记录节点标识与时间。
  2. 切换到 作业监控,核对该节点上是否有自身作业处于异常或排队状态。
  3. 若节点持续异常导致训练任务中断或推理延迟,联系运营管理员排查节点健康状况。

能力开放时重点查看 ​

  • 节点是否 Ready 或可调度。
  • CPU、内存、GPU 曲线是否持续高位。
  • 曲线是否中断或更新时间明显滞后。

参数速查表 ​

字段名称是否必填字段类型示例说明
节点名必填文本node-gpu-01定位具体节点。
地域条件必填下拉选择华中一区限定节点所属地域。
集群条件必填下拉选择cluster-a限定节点所属集群。
CPU 使用率系统生成百分比72%判断节点 CPU 压力。
内存使用率系统生成百分比81%判断节点内存压力。
GPU 使用率系统生成百分比65%判断节点加速卡计算压力。
节点状态系统生成状态Ready展示节点是否可用或异常。

踩坑提示 ​

  • CPU 或内存曲线短暂升高不一定是故障,要结合任务运行窗口。
  • 曲线中断可能是采集延迟,也可能是节点不可用。
  • 用户侧通常不能直接维护节点,排障时应准备时间范围和实例信息给运营管理员。

排障信息准备 ​

节点页异常时,先准备以下信息,便于判断是单节点故障、资源耗尽还是采集延迟:

信息示例作用
节点名node-gpu-01定位具体机器。
所属集群cluster-prod-a判断节点归属和影响范围。
CPU / 内存曲线CPU 92% / 内存 85%判断是否资源高水位。
磁盘曲线磁盘 90%判断镜像拉取、日志写入和临时文件风险。
节点状态时间NotReady 10 分钟判断异常持续时间。

结果校验 ​

检查项成功表现异常时处理
页面加载节点统计图表或列表正常显示检查当前角色的监控权限和所选地域是否开放采集能力
统计范围时间范围、地域和对象数量与排查目标一致清除筛选后逐项恢复条件,确认没有混用不同统计口径
数据新鲜度更新时间落在预期采集周期内到系统设置或监控采集组件核对采集周期、连接和告警
异常关联异常指标能关联到集群、节点、设备或作业保持相同时间范围,到相邻监控页和对象详情交叉核对

常见问题 ​

节点统计没有数据 ​

问题现象:

页面可进入,但图表或列表为空。

可能原因:

  • 所选时间没有任务。
  • 地域未开放采集。
  • 当前角色无指标权限。

处理方式:

  1. 扩大时间范围并重置筛选
  2. 核对地域监控能力
  3. 到相邻监控页确认是否同样无数据。

节点统计更新不及时 ​

问题现象:

页面数据长时间没有变化。

可能原因:

  • 采集周期尚未到。
  • 采集组件异常。
  • 页面缓存未刷新。

处理方式:

  1. 核对更新时间
  2. 检查采集组件和告警
  3. 刷新后用同一时间范围复查。

节点统计与相邻页面数值不一致 ​

问题现象:

同一对象在两个监控页面显示不同数值。

可能原因:

  • 聚合粒度不同。
  • 时间范围或时区不同。
  • 筛选对象不同。

处理方式:

  1. 统一时间范围和时区
  2. 核对聚合口径
  3. 清除筛选后逐项恢复。

无法在关联监控中定位目标对象 ​

问题现象:

点击指标或详情入口后找不到对应对象。

可能原因:

  • 对象已结束或被移除。
  • 角色不可见。
  • 关联标识不一致。

处理方式:

  1. 记录对象名称和时间
  2. 到对应列表核对状态
  3. 联系运营管理员检查可见范围。

异常峰值无法复现 ​

问题现象:

监控中出现峰值,但当前详情已恢复正常。

可能原因:

  • 峰值持续时间短。
  • 采样粒度较粗。
  • 任务已经结束。

处理方式:

  1. 锁定峰值时间段
  2. 对照作业和节点事件
  3. 保留脱敏截图和对象标识。

注意事项 ​

  • 节点名、IP 和标签属于运维敏感信息,截图前需脱敏。
  • 节点指标仅说明资源状态,业务失败还需要结合日志和事件。
  • 用户侧不能直接修复节点,应把证据交给运营管理员。

后续操作 ​

  1. 节点指标异常时,查看受影响作业或实例是否集中在该节点。
  2. GPU 相关问题继续进入设备监控。
  3. 如果节点持续异常,避免在同一规格上反复重试。