集群统计
功能概述
| 项目 | 内容 |
|---|---|
| 适用角色 | 模型提供方、模型调用方 |
| 导航路径 | AI基础设施 > On-Prem > 监控 > 集群统计 |
| 页面路由 | /powerone/user-monitor/cluster |
| 管理对象 | 用户可见范围内的集群资源趋势、容量和健康状态 |
新手理解
集群统计像用户可见资源池的产能表,用来判断当前地域还有多少集群容量、节点规模和加速卡资源可承接任务。
术语表
| 术语 | 说明 |
|---|---|
| 集群名 | 承载实例、作业和资源调度的 Kubernetes 集群标识。 |
| 健康状态 | 集群的整体可用情况,通常由采集、节点和调度状态共同决定。 |
| GPU 总数 | 当前集群中可见或纳入统计的加速卡数量。 |
推荐操作顺序
先确认用户可见范围内的集群资源趋势、容量和健康状态的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。
小白先看
先确认当前任务是否涉及用户可见范围内的集群资源趋势、容量和健康状态,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。
前提条件
- 当前账号可查看目标地域的集群统计。
- 运营管理员已将相关集群纳入用户侧监控范围。
- 集群监控数据已同步到用户侧页面。
- 当前账号具备查看资源水位或健康状态的权限。
页面说明
页面用于查看和处理用户可见范围内的集群资源趋势、容量和健康状态。

页面展示所选地域的集群统计能力。能力开放时,用户可以查看指标趋势、列表数据或关键状态;能力未开放时,页面会显示能力提示。
能力开放时页面预期
| 页面元素 | 示例 | 说明 |
|---|---|---|
| 集群列表 | prod-wuhan-gpu-1 | 展示用户可见范围内的集群。 |
| 集群水位 | GPU 12/32、CPU 60% | 判断容量是否紧张。 |
| 可用容量 | A100 剩余 4 卡 | 判断是否适合继续提交作业。 |
| 健康状态 | 可用 / 异常 / 维护中 | 判断集群是否适合新建实例。 |
| 容量趋势 | 近 24 小时资源使用率 | 判断短期资源压力。 |
主要操作
查看集群统计
- 进入
AI基础设施 > On-Prem > 监控 > 集群统计。 - 确认右上角地域与时间范围,按集群名称或状态筛选。
- 查看集群列表与运行状态,核对可用容量、CPU/GPU 水位及健康状态。
- 如监控能力未开放,可回到实例详情页查看具体日志、事件和状态。
排查集群异常指标
- 发现集群资源水位接近满载或处于维护状态时,记录集群名称与当前负载。
- 切换到
节点统计或作业监控,核对各节点利用率与当前排队作业情况。 - 若集群容量持续不足导致新实例无法创建,联系管理员申请调整配额或分配其他可用资源池。
重点关注
- 集群健康状态是否正常。
- 节点数、GPU 总数和 CPU 总数是否符合预期。
- 资源水位有没有接近影响新任务创建的阈值。
参数速查表
| 字段名称 | 是否必填 | 字段类型 | 示例 | 说明 |
|---|---|---|---|---|
| 集群名 | 必填 | 文本 | cluster-a | 定位用户可见的集群对象。 |
| 地域 | 条件必填 | 下拉选择 | 华中一区 | 限定集群所属地域。 |
| 节点数 | 系统生成 | 数字 | 24 | 集群中纳入统计的节点数量。 |
| GPU 总数 | 系统生成 | 数字 | 96 | 集群可见加速卡总量。 |
| CPU 总数 | 系统生成 | 数字 | 1536 Core | 集群 CPU 总容量。 |
| 健康状态 | 系统生成 | 状态 | 健康 | 展示集群是否可用、告警或采集异常。 |
踩坑提示
- 集群水位高不一定表示自己的任务会失败,还要看目标规格和配额。
- 集群健康异常时,不要反复提交相同作业,应先确认平台事件。
- 不同地域的集群资源不能混在一起判断。
排障信息准备
集群页异常时,先准备以下信息,便于判断是集群接入、资源水位还是采集问题:
| 信息 | 示例 | 作用 |
|---|---|---|
| 集群名 | cluster-prod-a | 定位目标集群。 |
| 地域 / 可用区 | 武汉 / wuhan-1 | 判断资源归属范围。 |
| 节点数 | 32 | 判断集群容量是否符合预期。 |
| 健康状态 | 异常 / 高水位 / 无数据 | 区分容量问题和采集问题。 |
| 关联作业时间 | 2026-07-13 10:00 | 对齐作业提交和监控曲线。 |
结果校验
| 检查项 | 成功表现 | 异常时处理 |
|---|---|---|
| 页面加载 | 集群统计图表或列表正常显示 | 检查当前角色的监控权限和所选地域是否开放采集能力 |
| 统计范围 | 时间范围、地域和对象数量与排查目标一致 | 清除筛选后逐项恢复条件,确认没有混用不同统计口径 |
| 数据新鲜度 | 更新时间落在预期采集周期内 | 到系统设置或监控采集组件核对采集周期、连接和告警 |
| 异常关联 | 异常指标能关联到集群、节点、设备或作业 | 保持相同时间范围,到相邻监控页和对象详情交叉核对 |
常见问题
集群统计没有数据
问题现象:
页面可进入,但图表或列表为空。
可能原因:
- 所选时间没有任务。
- 地域未开放采集。
- 当前角色无指标权限。
处理方式:
- 扩大时间范围并重置筛选
- 核对地域监控能力
- 到相邻监控页确认是否同样无数据。
集群统计更新不及时
问题现象:
页面数据长时间没有变化。
可能原因:
- 采集周期尚未到。
- 采集组件异常。
- 页面缓存未刷新。
处理方式:
- 核对更新时间
- 检查采集组件和告警
- 刷新后用同一时间范围复查。
集群统计与相邻页面数值不一致
问题现象:
同一对象在两个监控页面显示不同数值。
可能原因:
- 聚合粒度不同。
- 时间范围或时区不同。
- 筛选对象不同。
处理方式:
- 统一时间范围和时区
- 核对聚合口径
- 清除筛选后逐项恢复。
无法在关联监控中定位目标对象
问题现象:
点击指标或详情入口后找不到对应对象。
可能原因:
- 对象已结束或被移除。
- 角色不可见。
- 关联标识不一致。
处理方式:
- 记录对象名称和时间
- 到对应列表核对状态
- 联系运营管理员检查可见范围。
异常峰值无法复现
问题现象:
监控中出现峰值,但当前详情已恢复正常。
可能原因:
- 峰值持续时间短。
- 采样粒度较粗。
- 任务已经结束。
处理方式:
- 锁定峰值时间段
- 对照作业和节点事件
- 保留脱敏截图和对象标识。
注意事项
- 不要在截图中暴露真实集群名、内部域名或节点 IP。
- 集群健康状态和单个实例状态可能不同步,需要结合日志和事件判断。
- 容量不足时优先确认目标规格,而不是只看总集群水位。
后续操作
- 进入节点统计查看是否由少数节点导致集群异常。
- 进入设备监控确认 GPU/NPU 资源是否充足。
- 创建任务前结合资源配额和规格可用性一起判断。