场景概览 - 可观测与问题排查
本场景介绍如何从模型调用、租户范围和基础资源三个视角定位吞吐、时延、失败、排队和资源异常。
适用角色
- 运营管理员、模型提供方、最终用户
场景目标
- 先确认影响范围和时间范围,再选择正确监控入口。
- 将错误对应到请求、模型、作业、节点或设备。
- 形成可复核且不包含完整凭据的排障证据。
场景流程
主线: 明确现象和时间 → 定位问题层级 → 收集关联证据 → 修复并复测
| 阶段 | 核心结果 |
|---|---|
| 1. 明确现象 | 用户、模型、部署、作业和时间范围被准确记录 |
| 2. 定位层级 | 问题归入调用、部署、调度、节点、设备或权限层 |
| 3. 收集证据 | 日志、事件、监控和配置在同一时间线相互对应 |
| 4. 修复复测 | 处理动作明确,原始请求或工作负载复测通过 |
开始前准备
- 准备脱敏后的请求、实例或作业标识。
- 明确租户、地域、模型和时间范围。
推荐阅读顺序
- 确认影响范围
- 检查调用或作业状态
- 下钻到节点和设备
- 记录证据并复测
文档索引
| 文档 | 说明 |
|---|---|
| 问题排查流程 | 问题分流、通用排查顺序、完成检查和监控截图 |
完成检查
用途: 以下检查是本场景的退出条件,用于判断是否已经取得可观察、可复核的结果,以及是否可以进入下一场景。它不是操作步骤的重复;任一项不满足时,请返回对应功能文档的“常见失败分支”排查。
| 检查项 | 通过标准 |
|---|---|
| 1 | 问题对象、时间范围和可复现现象已经记录。 |
| 2 | 日志、事件、监控或配置证据将问题定位到明确层级和对象。 |
| 3 | 修复或规避动作执行后,原始请求或工作负载复测通过且没有同类持续错误。 |