可观测与问题排查
本场景指导运营方、模型提供方和调用方先判断问题属于调用、模型服务、云上部署、异构卡纳管资源还是计量,再进入对应日志和监控页面,避免在错误子系统中反复搜索。
适用角色
- 在各自权限范围排查问题的平台用户、模型提供方和平台运营方
场景目标
- 问题具备角色、时间范围、模型或资源编号和可复现现象。
- 能把问题定位到调用、部署、作业、节点、设备或计量层。
- 日志、事件、监控和用量数据使用相同时间范围进行关联。
- 排障材料脱敏且足以交接给下一责任方。
开始前准备
- 记录发生时间、账号角色、租户、子系统和操作入口。
- 记录脱敏后的模型、部署、实例、作业或请求标识。
- 区分“不可见、创建失败、运行失败、调用失败、性能下降、用量异常”。
- 不在工单或群聊中发送完整 Prompt、响应、Token、密钥或内部 接口地址。
问题分流
| 现象 | 首要入口 | 参考手册 |
|---|---|---|
| 模型 API 调用失败或响应异常 | 我的调用 / 客户调用日志 | 调用日志、客户调用日志 |
| 调用成功率、时延或 Token 异常 | 调用分析 | 我的调用分析、客户调用分析 |
| 云上部署失败或不可访问 | 我的部署详情、事件和监控 | 我的部署 |
| 异构卡纳管作业排队或失败 | 作业监控、实例事件和日志 | 作业监控、模型实例 |
| 节点或加速卡异常 | 节点统计、设备监控 | 节点统计、设备监控 |
| 配额、用量或金额异常 | 配额、计量明细和模型用量 | 异构卡纳管:资源计量与监控、模型的消费与收益 |
通用排查顺序
- 复现并记录第一条错误,不要只记录最后的连锁错误。
- 确认账号、租户、地域、模型和时间筛选正确。
- 从用户可见状态进入事件和日志,再进入节点或设备监控。
- 对调用问题同时核对请求日志和模型服务状态。
- 对资源问题同时核对作业状态、节点容量和设备健康。
- 对用量问题先核对真实运行记录,再核对计量明细和账期汇总。
判断故障层级时,使用 异构卡纳管监控概览在同一时间范围内对比集群、节点、设备和作业信号。

完成检查
用途: 以下检查是当前功能任务的退出条件,用于判断操作结果是否可观察、可复核,以及是否可以继续当前场景的下一步。它不是操作步骤的重复;任一项不满足时,请按下方“常见失败分支”继续排查。
| 检查项 | 通过标准 |
|---|---|
| 1 | 已明确问题层级和当前责任方。 |
| 2 | 错误时间与日志、事件、监控时间一致。 |
| 3 | 已确认是否影响单个请求、单个实例、单个租户或整个平台。 |
| 4 | 修复或规避后已用相同条件重新验证。 |
| 5 | 交接材料包含入口、步骤、期望、实际、时间和脱敏证据。 |
常见失败分支与误区
- 只看汇总监控,不查看失败事件或请求日志。
- 时间范围、地域或租户筛选不一致,导致数据无法对应。
- 把权限不可见误判为资源不存在。
- 把配额不足、账户额度不足和集群容量不足混为一类问题。
- 复制完整请求或凭据作为排障材料。