Skip to content

设备监控 ​

功能概述 ​

项目内容
适用角色模型提供方、模型调用方
导航路径AI基础设施 > On-Prem > 监控 > 设备监控
页面路由/powerone/user-monitor/device
管理对象用户可见范围内的 GPU/NPU 等设备利用率、显存和健康状态

新手理解 ​

设备监控像每张 GPU/NPU 的体检表,用来查看设备类型、健康状态、温度和显存使用率,判断加速卡是否影响任务运行。

术语表 ​

术语说明
设备名单个 GPU/NPU 或其他加速设备的标识。
设备类型加速设备的型号或厂商类型,例如 GPU 或 NPU。
显存使用率设备显存的占用比例,会影响模型能否启动。

推荐操作顺序 ​

先确认用户可见范围内的 GPU/NPU 等设备利用率、显存和健康状态的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。

小白先看 ​

先确认当前任务是否涉及用户可见范围内的 GPU/NPU 等设备利用率、显存和健康状态,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。

前提条件 ​

  1. 当前账号具备设备监控查看权限。
  2. 目标地域存在可见 GPU/NPU 资源。
  3. 设备插件和监控采集数据正常上报。
  4. 需要排查的任务已明确使用的设备类型或规格。

页面说明 ​

页面用于查看和处理用户可见范围内的 GPU/NPU 等设备利用率、显存和健康状态。

设备监控

页面展示所选地域的设备监控能力。能力开放时,用户可以查看指标趋势、列表数据或关键状态;能力未开放时,页面会显示能力提示。

能力开放时页面预期 ​

页面元素示例说明
设备列表GPU 0 / NPU 0展示用户可见范围内的加速卡设备。
利用率图表GPU Util 85%判断设备是否忙碌或长期空闲。
显存指标60GiB / 80GiB判断模型或训练任务是否接近显存上限。
温度与健康状态72C / Healthy判断硬件健康、散热或驱动异常风险。
更新时间2026-07-03 10:00判断采集是否延迟。

主要操作 ​

查看设备监控 ​

  1. 进入 AI基础设施 > On-Prem > 监控 > 设备监控。
  2. 确认右上角地域与时间范围,按设备型号、状态或关键字筛选。
  3. 查看设备列表与利用率图表,核对 GPU/NPU 使用率、显存占用与温度健康状态。
  4. 如监控能力未开放,可回到具体作业或实例详情页查看关联状态与日志。

排查设备异常指标 ​

  1. 发现设备利用率持续为 0% 却处于占用状态,或显存持续高位报警时,记录设备标识与时间范围。
  2. 切换至 作业监控,核对占用该设备的作业运行状态是否存在死锁或显存泄漏风险。
  3. 若设备显示离线、温度异常过高或驱动故障,及时联系运营管理员排查物理节点与硬件健康状况。

能力开放时重点查看 ​

  • GPU/NPU 利用率是否为空或持续异常。
  • 显存使用率是否接近上限。
  • 温度和健康状态是否存在告警。

参数速查表 ​

字段名称是否必填字段类型示例说明
设备名必填文本GPU-0定位单张设备。
设备类型必填枚举NVIDIA A800展示加速卡型号或类型。
节点 IP条件必填文本10.0.0.*定位设备所在节点,文档和截图应脱敏。
健康状态系统生成状态正常展示设备是否可用或异常。
温度系统生成数值71°C辅助判断硬件健康和散热。
显存使用率系统生成百分比78%判断模型或作业显存压力。
GPU/NPU 利用率系统生成百分比63%判断计算单元负载。

踩坑提示 ​

  • 利用率为空可能是未采集、无任务或设备插件异常,不能直接判断为空闲。
  • 显存高位会直接影响模型启动,即使集群总容量看起来充足。
  • 温度异常应按硬件健康处理,不建议只通过重试任务规避。

排障信息准备 ​

设备页异常时,先准备以下信息,便于判断是设备采集、显存压力还是硬件健康问题:

信息示例作用
设备名 / 编号GPU-0定位单张 GPU/NPU。
节点 IP / 节点名node-gpu-01找到设备所在节点。
利用率GPU 95%判断计算单元是否高负载。
显存76 GB / 80 GB判断是否显存不足。
温度 / 健康状态78°C / 告警判断是否需要硬件运维介入。

结果校验 ​

检查项成功表现异常时处理
页面加载设备监控图表或列表正常显示检查当前角色的监控权限和所选地域是否开放采集能力
统计范围时间范围、地域和对象数量与排查目标一致清除筛选后逐项恢复条件,确认没有混用不同统计口径
数据新鲜度更新时间落在预期采集周期内到系统设置或监控采集组件核对采集周期、连接和告警
异常关联异常指标能关联到集群、节点、设备或作业保持相同时间范围,到相邻监控页和对象详情交叉核对

常见问题 ​

设备监控没有数据 ​

问题现象:

页面可进入,但图表或列表为空。

可能原因:

  • 所选时间没有任务。
  • 地域未开放采集。
  • 当前角色无指标权限。

处理方式:

  1. 扩大时间范围并重置筛选
  2. 核对地域监控能力
  3. 到相邻监控页确认是否同样无数据。

设备监控更新不及时 ​

问题现象:

页面数据长时间没有变化。

可能原因:

  • 采集周期尚未到。
  • 采集组件异常。
  • 页面缓存未刷新。

处理方式:

  1. 核对更新时间
  2. 检查采集组件和告警
  3. 刷新后用同一时间范围复查。

设备监控与相邻页面数值不一致 ​

问题现象:

同一对象在两个监控页面显示不同数值。

可能原因:

  • 聚合粒度不同。
  • 时间范围或时区不同。
  • 筛选对象不同。

处理方式:

  1. 统一时间范围和时区
  2. 核对聚合口径
  3. 清除筛选后逐项恢复。

无法在关联监控中定位目标对象 ​

问题现象:

点击指标或详情入口后找不到对应对象。

可能原因:

  • 对象已结束或被移除。
  • 角色不可见。
  • 关联标识不一致。

处理方式:

  1. 记录对象名称和时间
  2. 到对应列表核对状态
  3. 联系运营管理员检查可见范围。

异常峰值无法复现 ​

问题现象:

监控中出现峰值,但当前详情已恢复正常。

可能原因:

  • 峰值持续时间短。
  • 采样粒度较粗。
  • 任务已经结束。

处理方式:

  1. 锁定峰值时间段
  2. 对照作业和节点事件
  3. 保留脱敏截图和对象标识。

注意事项 ​

  • 节点 IP、设备编号和硬件状态截图应脱敏。
  • 设备监控只能说明硬件侧情况,模型参数错误仍需看实例日志。
  • 不要把单卡利用率低直接等同为资源浪费,可能是采样窗口或任务类型导致。

后续操作 ​

  1. 显存不足时,回到实例或作业配置降低模型规模、并发或上下文长度。
  2. 设备健康异常时,避免继续选择同一设备类型提交高优先级任务。
  3. 需要运营管理员处理时提供设备类型、节点、时间范围和错误现象。