Skip to content

集群统计 ​

功能概述 ​

项目内容
适用角色模型提供方、模型调用方
导航路径AI基础设施 > On-Prem > 监控 > 集群统计
页面路由/powerone/user-monitor/cluster
管理对象用户可见范围内的集群资源趋势、容量和健康状态

新手理解 ​

集群统计像用户可见资源池的产能表,用来判断当前地域还有多少集群容量、节点规模和加速卡资源可承接任务。

术语表 ​

术语说明
集群名承载实例、作业和资源调度的 Kubernetes 集群标识。
健康状态集群的整体可用情况,通常由采集、节点和调度状态共同决定。
GPU 总数当前集群中可见或纳入统计的加速卡数量。

推荐操作顺序 ​

先确认用户可见范围内的集群资源趋势、容量和健康状态的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。

小白先看 ​

先确认当前任务是否涉及用户可见范围内的集群资源趋势、容量和健康状态,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。

前提条件 ​

  1. 当前账号可查看目标地域的集群统计。
  2. 运营管理员已将相关集群纳入用户侧监控范围。
  3. 集群监控数据已同步到用户侧页面。
  4. 当前账号具备查看资源水位或健康状态的权限。

页面说明 ​

页面用于查看和处理用户可见范围内的集群资源趋势、容量和健康状态。

集群统计

页面展示所选地域的集群统计能力。能力开放时,用户可以查看指标趋势、列表数据或关键状态;能力未开放时,页面会显示能力提示。

能力开放时页面预期 ​

页面元素示例说明
集群列表prod-wuhan-gpu-1展示用户可见范围内的集群。
集群水位GPU 12/32、CPU 60%判断容量是否紧张。
可用容量A100 剩余 4 卡判断是否适合继续提交作业。
健康状态可用 / 异常 / 维护中判断集群是否适合新建实例。
容量趋势近 24 小时资源使用率判断短期资源压力。

主要操作 ​

查看集群统计 ​

  1. 进入 AI基础设施 > On-Prem > 监控 > 集群统计。
  2. 确认右上角地域与时间范围,按集群名称或状态筛选。
  3. 查看集群列表与运行状态,核对可用容量、CPU/GPU 水位及健康状态。
  4. 如监控能力未开放,可回到实例详情页查看具体日志、事件和状态。

排查集群异常指标 ​

  1. 发现集群资源水位接近满载或处于维护状态时,记录集群名称与当前负载。
  2. 切换到 节点统计 或 作业监控,核对各节点利用率与当前排队作业情况。
  3. 若集群容量持续不足导致新实例无法创建,联系管理员申请调整配额或分配其他可用资源池。

重点关注 ​

  • 集群健康状态是否正常。
  • 节点数、GPU 总数和 CPU 总数是否符合预期。
  • 资源水位有没有接近影响新任务创建的阈值。

参数速查表 ​

字段名称是否必填字段类型示例说明
集群名必填文本cluster-a定位用户可见的集群对象。
地域条件必填下拉选择华中一区限定集群所属地域。
节点数系统生成数字24集群中纳入统计的节点数量。
GPU 总数系统生成数字96集群可见加速卡总量。
CPU 总数系统生成数字1536 Core集群 CPU 总容量。
健康状态系统生成状态健康展示集群是否可用、告警或采集异常。

踩坑提示 ​

  • 集群水位高不一定表示自己的任务会失败,还要看目标规格和配额。
  • 集群健康异常时,不要反复提交相同作业,应先确认平台事件。
  • 不同地域的集群资源不能混在一起判断。

排障信息准备 ​

集群页异常时,先准备以下信息,便于判断是集群接入、资源水位还是采集问题:

信息示例作用
集群名cluster-prod-a定位目标集群。
地域 / 可用区武汉 / wuhan-1判断资源归属范围。
节点数32判断集群容量是否符合预期。
健康状态异常 / 高水位 / 无数据区分容量问题和采集问题。
关联作业时间2026-07-13 10:00对齐作业提交和监控曲线。

结果校验 ​

检查项成功表现异常时处理
页面加载集群统计图表或列表正常显示检查当前角色的监控权限和所选地域是否开放采集能力
统计范围时间范围、地域和对象数量与排查目标一致清除筛选后逐项恢复条件,确认没有混用不同统计口径
数据新鲜度更新时间落在预期采集周期内到系统设置或监控采集组件核对采集周期、连接和告警
异常关联异常指标能关联到集群、节点、设备或作业保持相同时间范围,到相邻监控页和对象详情交叉核对

常见问题 ​

集群统计没有数据 ​

问题现象:

页面可进入,但图表或列表为空。

可能原因:

  • 所选时间没有任务。
  • 地域未开放采集。
  • 当前角色无指标权限。

处理方式:

  1. 扩大时间范围并重置筛选
  2. 核对地域监控能力
  3. 到相邻监控页确认是否同样无数据。

集群统计更新不及时 ​

问题现象:

页面数据长时间没有变化。

可能原因:

  • 采集周期尚未到。
  • 采集组件异常。
  • 页面缓存未刷新。

处理方式:

  1. 核对更新时间
  2. 检查采集组件和告警
  3. 刷新后用同一时间范围复查。

集群统计与相邻页面数值不一致 ​

问题现象:

同一对象在两个监控页面显示不同数值。

可能原因:

  • 聚合粒度不同。
  • 时间范围或时区不同。
  • 筛选对象不同。

处理方式:

  1. 统一时间范围和时区
  2. 核对聚合口径
  3. 清除筛选后逐项恢复。

无法在关联监控中定位目标对象 ​

问题现象:

点击指标或详情入口后找不到对应对象。

可能原因:

  • 对象已结束或被移除。
  • 角色不可见。
  • 关联标识不一致。

处理方式:

  1. 记录对象名称和时间
  2. 到对应列表核对状态
  3. 联系运营管理员检查可见范围。

异常峰值无法复现 ​

问题现象:

监控中出现峰值,但当前详情已恢复正常。

可能原因:

  • 峰值持续时间短。
  • 采样粒度较粗。
  • 任务已经结束。

处理方式:

  1. 锁定峰值时间段
  2. 对照作业和节点事件
  3. 保留脱敏截图和对象标识。

注意事项 ​

  • 不要在截图中暴露真实集群名、内部域名或节点 IP。
  • 集群健康状态和单个实例状态可能不同步,需要结合日志和事件判断。
  • 容量不足时优先确认目标规格,而不是只看总集群水位。

后续操作 ​

  1. 进入节点统计查看是否由少数节点导致集群异常。
  2. 进入设备监控确认 GPU/NPU 资源是否充足。
  3. 创建任务前结合资源配额和规格可用性一起判断。