Skip to content

作业监控 ​

功能概述 ​

项目内容
适用角色模型提供方、模型调用方
导航路径AI基础设施 > On-Prem > 监控 > 作业监控
页面路由/powerone/user-monitor/work
管理对象用户可见范围内的模型实例、在线 IDE、运行实例和历史作业

新手理解 ​

作业监控像个人任务排队清单,用来查看作业 ID、状态、排队时长、运行时长、GPU 占用和失败原因。

术语表 ​

术语说明
作业 ID用于定位单个训练、推理或运行任务的标识。
排队时长作业等待资源或满足调度条件所经历的时间。
运行时长作业开始运行后的持续时长。

推荐操作顺序 ​

先确认用户可见范围内的模型实例、在线 IDE、运行实例和历史作业的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。

小白先看 ​

先确认当前任务是否涉及用户可见范围内的模型实例、在线 IDE、运行实例和历史作业,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。

前提条件 ​

  1. 当前账号具备作业监控查看权限。
  2. 目标作业属于当前账号或当前租户可见范围。
  3. 作业已经提交并产生状态、事件或监控数据。
  4. 已明确要排查的作业 ID 或提交时间。

页面说明 ​

页面用于查看和处理用户可见范围内的模型实例、在线 IDE、运行实例和历史作业。

作业监控

页面展示所选地域的作业监控能力。能力开放时,用户可以查看指标趋势、列表数据或关键状态;能力未开放时,页面会显示能力提示。

能力开放时页面预期 ​

页面元素示例说明
作业列表train-job-001展示模型实例、在线 IDE 或运行实例关联作业。
作业状态运行中 / 排队 / 失败判断任务生命周期和当前处理阶段。
排队原因资源不足 / 镜像拉取中帮助定位创建慢或无法启动的原因。
运行时长2h 13m判断任务是否超出预期运行周期。
失败信息ImagePullBackOff判断是否需要查看日志、事件或联系运营管理员。

主要操作 ​

查看作业监控 ​

  1. 进入 AI基础设施 > On-Prem > 监控 > 作业监控。
  2. 确认右上角地域与时间范围,按作业状态或关键字筛选。
  3. 查看图表与作业列表,核对作业排队时长、运行时长以及 GPU 占用情况。
  4. 如监控能力未开放,回到具体实例或任务详情查看日志、事件和状态。

排查作业异常指标 ​

  1. 发现作业长时间排队、突发中断或状态显示失败时,记录作业 ID 与时间范围。
  2. 检查失败信息是否指向配额不足、镜像拉取失败、启动命令异常或 OOM。
  3. 结合节点与设备监控,排查是否由于节点资源不可用导致调度延迟;必要时联系管理员处理。

能力开放时重点查看 ​

  • 作业是否长时间排队。
  • 失败原因是否指向配额、镜像、启动命令或资源不足。
  • GPU 占用和运行时长是否符合预期。

参数速查表 ​

字段名称是否必填字段类型示例说明
作业 ID必填文本job-20260706-001定位单个作业。
状态系统生成状态Running展示排队、运行、成功或失败。
排队时长系统生成时长18 分钟判断是否存在调度等待。
运行时长系统生成时长2 小时 15 分钟判断任务是否超出预期。
GPU 占用系统生成数字 / 规格2 * A800展示作业占用的加速卡资源。
失败原因系统生成文本ImagePullBackOff辅助定位失败方向。
提交时间系统生成日期时间2026-07-06 09:30用于和日志、事件、用量对齐。

踩坑提示 ​

  • 作业排队通常与配额、规格、容量或调度条件有关,不要只刷新页面。
  • 失败原因为空时,优先查看实例事件和日志。
  • GPU 占用正常但结果异常时,需要回到训练脚本或模型参数排查。

排障信息准备 ​

作业页异常时,先准备以下信息,便于判断是排队、失败、资源不足还是历史数据保留问题:

信息示例作用
作业 IDjob-20260713001精确定位任务记录。
作业状态Queued / Failed / Running判断处理方向。
排队时长25 分钟判断调度和资源等待问题。
失败时间2026-07-13 10:15对齐事件、日志和监控曲线。
规格 / 队列2 * A800 / gpu-prod判断资源池和配额是否匹配。

结果校验 ​

检查项成功表现异常时处理
页面加载作业监控图表或列表正常显示检查当前角色的监控权限和所选地域是否开放采集能力
统计范围时间范围、地域和对象数量与排查目标一致清除筛选后逐项恢复条件,确认没有混用不同统计口径
数据新鲜度更新时间落在预期采集周期内到系统设置或监控采集组件核对采集周期、连接和告警
异常关联异常指标能关联到集群、节点、设备或作业保持相同时间范围,到相邻监控页和对象详情交叉核对

常见问题 ​

作业监控没有数据 ​

问题现象:

页面可进入,但图表或列表为空。

可能原因:

  • 所选时间没有任务。
  • 地域未开放采集。
  • 当前角色无指标权限。

处理方式:

  1. 扩大时间范围并重置筛选
  2. 核对地域监控能力
  3. 到相邻监控页确认是否同样无数据。

作业监控更新不及时 ​

问题现象:

页面数据长时间没有变化。

可能原因:

  • 采集周期尚未到。
  • 采集组件异常。
  • 页面缓存未刷新。

处理方式:

  1. 核对更新时间
  2. 检查采集组件和告警
  3. 刷新后用同一时间范围复查。

作业监控与相邻页面数值不一致 ​

问题现象:

同一对象在两个监控页面显示不同数值。

可能原因:

  • 聚合粒度不同。
  • 时间范围或时区不同。
  • 筛选对象不同。

处理方式:

  1. 统一时间范围和时区
  2. 核对聚合口径
  3. 清除筛选后逐项恢复。

无法在关联监控中定位目标对象 ​

问题现象:

点击指标或详情入口后找不到对应对象。

可能原因:

  • 对象已结束或被移除。
  • 角色不可见。
  • 关联标识不一致。

处理方式:

  1. 记录对象名称和时间
  2. 到对应列表核对状态
  3. 联系运营管理员检查可见范围。

异常峰值无法复现 ​

问题现象:

监控中出现峰值,但当前详情已恢复正常。

可能原因:

  • 峰值持续时间短。
  • 采样粒度较粗。
  • 任务已经结束。

处理方式:

  1. 锁定峰值时间段
  2. 对照作业和节点事件
  3. 保留脱敏截图和对象标识。

注意事项 ​

  • 作业 ID、镜像地址、数据路径和日志内容可能包含敏感信息。
  • 停止作业前确认输出文件和日志是否需要保留。
  • 同一错误反复出现时,应先调整配置再重试,避免持续消耗额度。

后续操作 ​

  1. 排队问题先核对配额、规格和设备容量。
  2. 失败问题先查看事件、镜像、启动命令和挂载路径。
  3. 高耗时作业应结合用量页面评估资源消耗。