设备监控
功能概述
| 项目 | 内容 |
|---|---|
| 适用角色 | 模型提供方、模型调用方 |
| 导航路径 | AI基础设施 > On-Prem > 监控 > 设备监控 |
| 页面路由 | /powerone/user-monitor/device |
| 管理对象 | 用户可见范围内的 GPU/NPU 等设备利用率、显存和健康状态 |
新手理解
设备监控像每张 GPU/NPU 的体检表,用来查看设备类型、健康状态、温度和显存使用率,判断加速卡是否影响任务运行。
术语表
| 术语 | 说明 |
|---|---|
| 设备名 | 单个 GPU/NPU 或其他加速设备的标识。 |
| 设备类型 | 加速设备的型号或厂商类型,例如 GPU 或 NPU。 |
| 显存使用率 | 设备显存的占用比例,会影响模型能否启动。 |
推荐操作顺序
先确认用户可见范围内的 GPU/NPU 等设备利用率、显存和健康状态的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。
小白先看
先确认当前任务是否涉及用户可见范围内的 GPU/NPU 等设备利用率、显存和健康状态,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。
前提条件
- 当前账号具备设备监控查看权限。
- 目标地域存在可见 GPU/NPU 资源。
- 设备插件和监控采集数据正常上报。
- 需要排查的任务已明确使用的设备类型或规格。
页面说明
页面用于查看和处理用户可见范围内的 GPU/NPU 等设备利用率、显存和健康状态。

页面展示所选地域的设备监控能力。能力开放时,用户可以查看指标趋势、列表数据或关键状态;能力未开放时,页面会显示能力提示。
能力开放时页面预期
| 页面元素 | 示例 | 说明 |
|---|---|---|
| 设备列表 | GPU 0 / NPU 0 | 展示用户可见范围内的加速卡设备。 |
| 利用率图表 | GPU Util 85% | 判断设备是否忙碌或长期空闲。 |
| 显存指标 | 60GiB / 80GiB | 判断模型或训练任务是否接近显存上限。 |
| 温度与健康状态 | 72C / Healthy | 判断硬件健康、散热或驱动异常风险。 |
| 更新时间 | 2026-07-03 10:00 | 判断采集是否延迟。 |
主要操作
查看设备监控
- 进入
AI基础设施 > On-Prem > 监控 > 设备监控。 - 确认右上角地域与时间范围,按设备型号、状态或关键字筛选。
- 查看设备列表与利用率图表,核对 GPU/NPU 使用率、显存占用与温度健康状态。
- 如监控能力未开放,可回到具体作业或实例详情页查看关联状态与日志。
排查设备异常指标
- 发现设备利用率持续为 0% 却处于占用状态,或显存持续高位报警时,记录设备标识与时间范围。
- 切换至
作业监控,核对占用该设备的作业运行状态是否存在死锁或显存泄漏风险。 - 若设备显示离线、温度异常过高或驱动故障,及时联系运营管理员排查物理节点与硬件健康状况。
能力开放时重点查看
- GPU/NPU 利用率是否为空或持续异常。
- 显存使用率是否接近上限。
- 温度和健康状态是否存在告警。
参数速查表
| 字段名称 | 是否必填 | 字段类型 | 示例 | 说明 |
|---|---|---|---|---|
| 设备名 | 必填 | 文本 | GPU-0 | 定位单张设备。 |
| 设备类型 | 必填 | 枚举 | NVIDIA A800 | 展示加速卡型号或类型。 |
| 节点 IP | 条件必填 | 文本 | 10.0.0.* | 定位设备所在节点,文档和截图应脱敏。 |
| 健康状态 | 系统生成 | 状态 | 正常 | 展示设备是否可用或异常。 |
| 温度 | 系统生成 | 数值 | 71°C | 辅助判断硬件健康和散热。 |
| 显存使用率 | 系统生成 | 百分比 | 78% | 判断模型或作业显存压力。 |
| GPU/NPU 利用率 | 系统生成 | 百分比 | 63% | 判断计算单元负载。 |
踩坑提示
- 利用率为空可能是未采集、无任务或设备插件异常,不能直接判断为空闲。
- 显存高位会直接影响模型启动,即使集群总容量看起来充足。
- 温度异常应按硬件健康处理,不建议只通过重试任务规避。
排障信息准备
设备页异常时,先准备以下信息,便于判断是设备采集、显存压力还是硬件健康问题:
| 信息 | 示例 | 作用 |
|---|---|---|
| 设备名 / 编号 | GPU-0 | 定位单张 GPU/NPU。 |
| 节点 IP / 节点名 | node-gpu-01 | 找到设备所在节点。 |
| 利用率 | GPU 95% | 判断计算单元是否高负载。 |
| 显存 | 76 GB / 80 GB | 判断是否显存不足。 |
| 温度 / 健康状态 | 78°C / 告警 | 判断是否需要硬件运维介入。 |
结果校验
| 检查项 | 成功表现 | 异常时处理 |
|---|---|---|
| 页面加载 | 设备监控图表或列表正常显示 | 检查当前角色的监控权限和所选地域是否开放采集能力 |
| 统计范围 | 时间范围、地域和对象数量与排查目标一致 | 清除筛选后逐项恢复条件,确认没有混用不同统计口径 |
| 数据新鲜度 | 更新时间落在预期采集周期内 | 到系统设置或监控采集组件核对采集周期、连接和告警 |
| 异常关联 | 异常指标能关联到集群、节点、设备或作业 | 保持相同时间范围,到相邻监控页和对象详情交叉核对 |
常见问题
设备监控没有数据
问题现象:
页面可进入,但图表或列表为空。
可能原因:
- 所选时间没有任务。
- 地域未开放采集。
- 当前角色无指标权限。
处理方式:
- 扩大时间范围并重置筛选
- 核对地域监控能力
- 到相邻监控页确认是否同样无数据。
设备监控更新不及时
问题现象:
页面数据长时间没有变化。
可能原因:
- 采集周期尚未到。
- 采集组件异常。
- 页面缓存未刷新。
处理方式:
- 核对更新时间
- 检查采集组件和告警
- 刷新后用同一时间范围复查。
设备监控与相邻页面数值不一致
问题现象:
同一对象在两个监控页面显示不同数值。
可能原因:
- 聚合粒度不同。
- 时间范围或时区不同。
- 筛选对象不同。
处理方式:
- 统一时间范围和时区
- 核对聚合口径
- 清除筛选后逐项恢复。
无法在关联监控中定位目标对象
问题现象:
点击指标或详情入口后找不到对应对象。
可能原因:
- 对象已结束或被移除。
- 角色不可见。
- 关联标识不一致。
处理方式:
- 记录对象名称和时间
- 到对应列表核对状态
- 联系运营管理员检查可见范围。
异常峰值无法复现
问题现象:
监控中出现峰值,但当前详情已恢复正常。
可能原因:
- 峰值持续时间短。
- 采样粒度较粗。
- 任务已经结束。
处理方式:
- 锁定峰值时间段
- 对照作业和节点事件
- 保留脱敏截图和对象标识。
注意事项
- 节点 IP、设备编号和硬件状态截图应脱敏。
- 设备监控只能说明硬件侧情况,模型参数错误仍需看实例日志。
- 不要把单卡利用率低直接等同为资源浪费,可能是采样窗口或任务类型导致。
后续操作
- 显存不足时,回到实例或作业配置降低模型规模、并发或上下文长度。
- 设备健康异常时,避免继续选择同一设备类型提交高优先级任务。
- 需要运营管理员处理时提供设备类型、节点、时间范围和错误现象。