统计概览
功能概述
| 项目 | 内容 |
|---|---|
| 适用角色 | 模型提供方、模型调用方 |
| 导航路径 | AI基础设施 > On-Prem > 监控 > 统计概览 |
| 页面路由 | /powerone/user-monitor/overview |
| 管理对象 | 资源池监控概况、实例运行状态和关键资源趋势 |
新手理解
统计概览像模型提供方或模型调用方的资源天气图,用一屏查看当前地域的集群数量、节点状态、异常数量和更新时间,先判断资源运行是否正常或存在异常波动。
术语表
| 术语 | 说明 |
|---|---|
| 时间范围 | 限定概览卡片、趋势和异常统计的查询时间窗口。 |
| 地域 | 当前用户可见的资源范围,切换地域后概览数据会随之变化。 |
| 异常数量 | 当前时间范围内失败作业、高水位资源或离线对象的汇总数量。 |
推荐操作顺序
先确认资源池监控概况、实例运行状态和关键资源趋势的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。
小白先看
先确认当前任务是否涉及资源池监控概况、实例运行状态和关键资源趋势,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。
前提条件
- 当前账号具备用户侧监控查看权限。
- 目标地域已经由运营管理员开放监控能力。
- 当前账号在该地域有可见实例、作业或资源。
- 监控采集数据已完成同步,页面更新时间不应明显滞后。
页面说明
页面用于查看和处理资源池监控概况、实例运行状态和关键资源趋势。

页面展示所选地域的统计概览能力。能力开放时,用户可以查看指标趋势、列表数据或关键状态;能力未开放时,页面会显示能力提示。
能力开放时页面预期
| 页面元素 | 示例 | 说明 |
|---|---|---|
| 总览卡片 | 集群数 / 节点数 / 作业数 / 告警数 | 快速判断资源池整体状态。 |
| 趋势入口 | 资源趋势 / 作业趋势 | 从总览跳转到集群、节点、设备或作业维度。 |
| 异常聚合 | 失败作业 / 高水位资源 / 离线节点 | 帮助用户优先处理影响当前实例的问题。 |
| 更新时间 | 2026-07-03 10:00 | 判断数据是否存在采集延迟。 |
主要操作
查看统计概览
- 进入
AI基础设施 > On-Prem > 监控 > 统计概览。 - 确认右上角地域与时间范围。
- 查看总览卡片中的集群数、节点状态、作业分布与异常数量。
- 查看资源使用趋势,确认计算与存储负载是否与近期任务相符。
- 如当前地域未开放监控能力,可前往实例详情页查看具体日志、事件与运行状态。
排查监控异常指标
- 在概览看板中发现失败作业陡增或资源水位接近瓶颈时,记录发生时段与受影响资源类型。
- 保持相同时间范围,通过左侧导航菜单进入
作业监控、集群统计、节点统计或设备监控。 - 核对具体异常作业或节点的报错原因,判断属于代码运行失败、配置冲突还是底层资源不足。
- 无法通过界面操作恢复时,记录脱敏作业 ID 与异常时间,联系运营管理员排查。
- 更新时间是否晚于最近一次操作。
参数速查表
| 字段名称 | 是否必填 | 字段类型 | 示例 | 说明 |
|---|---|---|---|---|
| 时间范围 | 必填 | 日期范围 | 近 1 小时 | 控制总览统计和趋势查询窗口。 |
| 地域 | 条件必填 | 下拉选择 | 华中一区 | 限定当前用户可见的资源范围。 |
| 集群数 | 系统生成 | 数字 | 3 | 当前地域可见或关联的集群数量。 |
| 节点状态 | 系统生成 | 状态 / 数字 | Ready 12 / NotReady 1 | 汇总节点可用性。 |
| 异常数量 | 系统生成 | 数字 | 2 | 聚合失败作业、离线节点或高水位资源。 |
| 更新时间 | 系统生成 | 日期时间 | 2026-07-06 10:00 | 判断监控数据是否及时刷新。 |
踩坑提示
- 总览适合判断方向,不适合作为单个实例失败的唯一依据。
- 异常数量与详情页不一致时,先固定地域和时间范围。
- 如果页面只显示能力提示,优先查看实例日志、事件和用量,再联系运营管理员确认开放条件。
排障信息准备
总览页异常时,先准备以下信息,便于区分时间窗口、地域范围和采集延迟:
| 信息 | 示例 | 作用 |
|---|---|---|
| 时间范围 | 近 1 小时 | 判断图表是否覆盖异常发生时间。 |
| 地域 | 武汉 | 判断总览是否只统计目标地域。 |
| 异常类型 | 集群异常 / 节点异常 / 设备高水位 / 作业失败 | 决定下一步进入哪个监控页。 |
| 更新时间 | 2026-07-13 10:20 | 判断数据是否存在采集延迟。 |
| 关联实例或作业 | job-20260713001 | 便于和事件、日志、用量记录交叉核对。 |
结果校验
| 检查项 | 成功表现 | 异常时处理 |
|---|---|---|
| 页面加载 | 统计概览图表或列表正常显示 | 检查当前角色的监控权限和所选地域是否开放采集能力 |
| 统计范围 | 时间范围、地域和对象数量与排查目标一致 | 清除筛选后逐项恢复条件,确认没有混用不同统计口径 |
| 数据新鲜度 | 更新时间落在预期采集周期内 | 到系统设置或监控采集组件核对采集周期、连接和告警 |
| 异常关联 | 异常指标能关联到集群、节点、设备或作业 | 保持相同时间范围,到相邻监控页和对象详情交叉核对 |
常见问题
统计概览没有数据
问题现象:
页面可进入,但图表或列表为空。
可能原因:
- 所选时间没有任务。
- 地域未开放采集。
- 当前角色无指标权限。
处理方式:
- 扩大时间范围并重置筛选
- 核对地域监控能力
- 到相邻监控页确认是否同样无数据。
统计概览更新不及时
问题现象:
页面数据长时间没有变化。
可能原因:
- 采集周期尚未到。
- 采集组件异常。
- 页面缓存未刷新。
处理方式:
- 核对更新时间
- 检查采集组件和告警
- 刷新后用同一时间范围复查。
统计概览与相邻页面数值不一致
问题现象:
同一对象在两个监控页面显示不同数值。
可能原因:
- 聚合粒度不同。
- 时间范围或时区不同。
- 筛选对象不同。
处理方式:
- 统一时间范围和时区
- 核对聚合口径
- 清除筛选后逐项恢复。
无法在关联监控中定位目标对象
问题现象:
点击指标或详情入口后找不到对应对象。
可能原因:
- 对象已结束或被移除。
- 角色不可见。
- 关联标识不一致。
处理方式:
- 记录对象名称和时间
- 到对应列表核对状态
- 联系运营管理员检查可见范围。
异常峰值无法复现
问题现象:
监控中出现峰值,但当前详情已恢复正常。
可能原因:
- 峰值持续时间短。
- 采样粒度较粗。
- 任务已经结束。
处理方式:
- 锁定峰值时间段
- 对照作业和节点事件
- 保留脱敏截图和对象标识。
注意事项
- 截图前遮挡租户名称、节点名、节点 IP 和业务标识。
- 不要把总览中的瞬时高水位直接等同于故障。
- 对外反馈时使用脱敏资源编号和时间范围。
后续操作
- 根据异常类型进入集群、节点、设备或作业页面继续定位。
- 如果只影响自己的实例,优先查看实例详情、日志和事件。
- 如果多类指标同时异常,记录时间范围和资源对象后联系运营管理员。