Skip to content

场景概览 - 可观测与问题排查 ​

本场景介绍如何从模型调用、租户范围和基础资源三个视角定位吞吐、时延、失败、排队和资源异常。

适用角色 ​

  • 运营管理员、模型提供方、最终用户

场景目标 ​

  • 先确认影响范围和时间范围,再选择正确监控入口。
  • 将错误对应到请求、模型、作业、节点或设备。
  • 形成可复核且不包含完整凭据的排障证据。

场景流程 ​

主线: 明确现象和时间 → 定位问题层级 → 收集关联证据 → 修复并复测

阶段核心结果
1. 明确现象用户、模型、部署、作业和时间范围被准确记录
2. 定位层级问题归入调用、部署、调度、节点、设备或权限层
3. 收集证据日志、事件、监控和配置在同一时间线相互对应
4. 修复复测处理动作明确,原始请求或工作负载复测通过

开始前准备 ​

  • 准备脱敏后的请求、实例或作业标识。
  • 明确租户、地域、模型和时间范围。

推荐阅读顺序 ​

  1. 确认影响范围
  2. 检查调用或作业状态
  3. 下钻到节点和设备
  4. 记录证据并复测

文档索引 ​

文档说明
问题排查流程问题分流、通用排查顺序、完成检查和监控截图

完成检查 ​

用途: 以下检查是本场景的退出条件,用于判断是否已经取得可观察、可复核的结果,以及是否可以进入下一场景。它不是操作步骤的重复;任一项不满足时,请返回对应功能文档的“常见失败分支”排查。

检查项通过标准
1问题对象、时间范围和可复现现象已经记录。
2日志、事件、监控或配置证据将问题定位到明确层级和对象。
3修复或规避动作执行后,原始请求或工作负载复测通过且没有同类持续错误。