作业监控
功能概述
| 项目 | 内容 |
|---|---|
| 适用角色 | 模型提供方、模型调用方 |
| 导航路径 | AI基础设施 > On-Prem > 监控 > 作业监控 |
| 页面路由 | /powerone/user-monitor/work |
| 管理对象 | 用户可见范围内的模型实例、在线 IDE、运行实例和历史作业 |
新手理解
作业监控像个人任务排队清单,用来查看作业 ID、状态、排队时长、运行时长、GPU 占用和失败原因。
术语表
| 术语 | 说明 |
|---|---|
| 作业 ID | 用于定位单个训练、推理或运行任务的标识。 |
| 排队时长 | 作业等待资源或满足调度条件所经历的时间。 |
| 运行时长 | 作业开始运行后的持续时长。 |
推荐操作顺序
先确认用户可见范围内的模型实例、在线 IDE、运行实例和历史作业的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。
小白先看
先确认当前任务是否涉及用户可见范围内的模型实例、在线 IDE、运行实例和历史作业,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。
前提条件
- 当前账号具备作业监控查看权限。
- 目标作业属于当前账号或当前租户可见范围。
- 作业已经提交并产生状态、事件或监控数据。
- 已明确要排查的作业 ID 或提交时间。
页面说明
页面用于查看和处理用户可见范围内的模型实例、在线 IDE、运行实例和历史作业。

页面展示所选地域的作业监控能力。能力开放时,用户可以查看指标趋势、列表数据或关键状态;能力未开放时,页面会显示能力提示。
能力开放时页面预期
| 页面元素 | 示例 | 说明 |
|---|---|---|
| 作业列表 | train-job-001 | 展示模型实例、在线 IDE 或运行实例关联作业。 |
| 作业状态 | 运行中 / 排队 / 失败 | 判断任务生命周期和当前处理阶段。 |
| 排队原因 | 资源不足 / 镜像拉取中 | 帮助定位创建慢或无法启动的原因。 |
| 运行时长 | 2h 13m | 判断任务是否超出预期运行周期。 |
| 失败信息 | ImagePullBackOff | 判断是否需要查看日志、事件或联系运营管理员。 |
主要操作
查看作业监控
- 进入
AI基础设施 > On-Prem > 监控 > 作业监控。 - 确认右上角地域与时间范围,按作业状态或关键字筛选。
- 查看图表与作业列表,核对作业排队时长、运行时长以及 GPU 占用情况。
- 如监控能力未开放,回到具体实例或任务详情查看日志、事件和状态。
排查作业异常指标
- 发现作业长时间排队、突发中断或状态显示失败时,记录作业 ID 与时间范围。
- 检查失败信息是否指向配额不足、镜像拉取失败、启动命令异常或 OOM。
- 结合节点与设备监控,排查是否由于节点资源不可用导致调度延迟;必要时联系管理员处理。
能力开放时重点查看
- 作业是否长时间排队。
- 失败原因是否指向配额、镜像、启动命令或资源不足。
- GPU 占用和运行时长是否符合预期。
参数速查表
| 字段名称 | 是否必填 | 字段类型 | 示例 | 说明 |
|---|---|---|---|---|
| 作业 ID | 必填 | 文本 | job-20260706-001 | 定位单个作业。 |
| 状态 | 系统生成 | 状态 | Running | 展示排队、运行、成功或失败。 |
| 排队时长 | 系统生成 | 时长 | 18 分钟 | 判断是否存在调度等待。 |
| 运行时长 | 系统生成 | 时长 | 2 小时 15 分钟 | 判断任务是否超出预期。 |
| GPU 占用 | 系统生成 | 数字 / 规格 | 2 * A800 | 展示作业占用的加速卡资源。 |
| 失败原因 | 系统生成 | 文本 | ImagePullBackOff | 辅助定位失败方向。 |
| 提交时间 | 系统生成 | 日期时间 | 2026-07-06 09:30 | 用于和日志、事件、用量对齐。 |
踩坑提示
- 作业排队通常与配额、规格、容量或调度条件有关,不要只刷新页面。
- 失败原因为空时,优先查看实例事件和日志。
- GPU 占用正常但结果异常时,需要回到训练脚本或模型参数排查。
排障信息准备
作业页异常时,先准备以下信息,便于判断是排队、失败、资源不足还是历史数据保留问题:
| 信息 | 示例 | 作用 |
|---|---|---|
| 作业 ID | job-20260713001 | 精确定位任务记录。 |
| 作业状态 | Queued / Failed / Running | 判断处理方向。 |
| 排队时长 | 25 分钟 | 判断调度和资源等待问题。 |
| 失败时间 | 2026-07-13 10:15 | 对齐事件、日志和监控曲线。 |
| 规格 / 队列 | 2 * A800 / gpu-prod | 判断资源池和配额是否匹配。 |
结果校验
| 检查项 | 成功表现 | 异常时处理 |
|---|---|---|
| 页面加载 | 作业监控图表或列表正常显示 | 检查当前角色的监控权限和所选地域是否开放采集能力 |
| 统计范围 | 时间范围、地域和对象数量与排查目标一致 | 清除筛选后逐项恢复条件,确认没有混用不同统计口径 |
| 数据新鲜度 | 更新时间落在预期采集周期内 | 到系统设置或监控采集组件核对采集周期、连接和告警 |
| 异常关联 | 异常指标能关联到集群、节点、设备或作业 | 保持相同时间范围,到相邻监控页和对象详情交叉核对 |
常见问题
作业监控没有数据
问题现象:
页面可进入,但图表或列表为空。
可能原因:
- 所选时间没有任务。
- 地域未开放采集。
- 当前角色无指标权限。
处理方式:
- 扩大时间范围并重置筛选
- 核对地域监控能力
- 到相邻监控页确认是否同样无数据。
作业监控更新不及时
问题现象:
页面数据长时间没有变化。
可能原因:
- 采集周期尚未到。
- 采集组件异常。
- 页面缓存未刷新。
处理方式:
- 核对更新时间
- 检查采集组件和告警
- 刷新后用同一时间范围复查。
作业监控与相邻页面数值不一致
问题现象:
同一对象在两个监控页面显示不同数值。
可能原因:
- 聚合粒度不同。
- 时间范围或时区不同。
- 筛选对象不同。
处理方式:
- 统一时间范围和时区
- 核对聚合口径
- 清除筛选后逐项恢复。
无法在关联监控中定位目标对象
问题现象:
点击指标或详情入口后找不到对应对象。
可能原因:
- 对象已结束或被移除。
- 角色不可见。
- 关联标识不一致。
处理方式:
- 记录对象名称和时间
- 到对应列表核对状态
- 联系运营管理员检查可见范围。
异常峰值无法复现
问题现象:
监控中出现峰值,但当前详情已恢复正常。
可能原因:
- 峰值持续时间短。
- 采样粒度较粗。
- 任务已经结束。
处理方式:
- 锁定峰值时间段
- 对照作业和节点事件
- 保留脱敏截图和对象标识。
注意事项
- 作业 ID、镜像地址、数据路径和日志内容可能包含敏感信息。
- 停止作业前确认输出文件和日志是否需要保留。
- 同一错误反复出现时,应先调整配置再重试,避免持续消耗额度。
后续操作
- 排队问题先核对配额、规格和设备容量。
- 失败问题先查看事件、镜像、启动命令和挂载路径。
- 高耗时作业应结合用量页面评估资源消耗。