Skip to content

作业监控 ​

功能概述 ​

项目内容
适用角色运营管理员
导航路径AI基础设施 > On-Prem > 监控 > 作业监控
页面路由/powerone/monitor/work
管理对象模型实例、在线 IDE、运行实例、训练任务和历史作业

新手理解 ​

作业监控像任务排队和执行清单,用来查看训练、推理或开发任务的状态、排队原因、运行时长和资源占用。

术语表 ​

术语说明
作业状态作业当前处于排队中、运行中、成功、失败或已取消等状态。
排队原因资源不足、配额限制或调度约束等导致作业无法启动的原因。
运行时长作业从启动到当前时间的持续时长。

推荐操作顺序 ​

先确认模型实例、在线 IDE、运行实例、训练任务和历史作业的前置依赖,再按主要操作顺序处理,最后执行结果校验并进入后续页面。

小白先看 ​

先确认当前任务是否涉及模型实例、在线 IDE、运行实例、训练任务和历史作业,再按照推荐顺序操作。页面字段或状态与预期不符时,先回到前置对象页核对依赖,不要跳过结果校验直接进入下游流程。

前提条件 ​

  1. 当前账号具备作业监控查看权限。
  2. 平台已采集作业状态、事件、排队和运行时长。
  3. 目标租户、用户或集群范围已明确。
  4. 需要排障时已准备作业 ID 或提交时间。

页面说明 ​

页面用于查看和处理模型实例、在线 IDE、运行实例、训练任务和历史作业。

作业监控

作业监控用于查看作业排队、运行中、失败原因和资源占用。运营管理员可用它分析资源不足、镜像拉取失败、启动异常或长时间运行任务。

主要操作 ​

筛选与查看作业监控 ​

  1. 进入 AI基础设施 > On-Prem > 监控 > 作业监控。
  2. 确认右上角地域与资源池,按作业状态、租户/用户、集群、资源类型或时间范围进行筛选。
  3. 查看作业列表与整体运行状态,核对作业 ID、作业名称、作业类型、作业状态、所属租户/用户、所属集群和资源占用。
  4. 查看排队时长、运行时长、GPU/加速卡占用、失败信息和事件入口,判断是否存在长时间排队、启动失败、资源不足或异常占用。

查看作业监控

排查作业异常指标 ​

  1. 发现作业批量排队、运行中卡死或突发失败增多时,记录异常作业 ID 与对应集群。
  2. 保持相同时间范围,结合 集群统计 与 节点统计 排查是否由于整体计算资源耗尽导致排队。
  3. 进入作业详情与实例日志,排查镜像拉取超时、启动命令错误、存储挂载失败或 OOM 崩溃等问题。
  4. 如确认需取消死锁作业或重新调度,依据平台运维规程处理,不擅自批量强杀正常业务作业。

重点关注 ​

  • 失败和排队作业是否异常增多。
  • 长时间运行作业是否占用关键资源。
  • 作业所属租户、规格、镜像和集群是否符合预期。

参数速查表 ​

字段名称是否必填字段类型示例说明
作业 ID必填文本job-20260706-001定位单个作业或任务实例。
作业名称条件必填文本inference-job辅助按业务名称定位作业。
作业类型条件必填枚举运行实例区分模型实例、在线 IDE、运行实例、训练任务或历史作业。
作业状态系统生成状态Running展示作业处于排队、运行、成功或失败状态。
所属租户 / 用户条件必填文本tenant-a用于按租户或用户定位作业归属。
所属集群条件必填文本cluster-prod-a定位作业运行或排队的集群。
节点系统生成文本node-gpu-01展示作业实际调度到的节点。
资源规格系统生成文本2 * A800展示作业申请或占用的资源规格。
GPU / 加速卡占用系统生成数字 / 文本2 * A800展示作业占用的加速卡规格和数量。
排队时长系统生成时长18 分钟判断调度是否存在等待或资源不足。
运行时长系统生成时长2 小时 15 分钟判断作业运行是否超出预期。
失败信息系统生成文本ImagePullBackOff辅助定位作业失败原因。
时间范围条件必填日期范围近 1 小时控制统计卡片、趋势图和列表数据的查询窗口。

踩坑提示 ​

  • 作业排队不一定是故障,可能是资源或配额不足。
  • 失败原因要结合事件、日志和镜像拉取状态判断。
  • 长时间运行作业应关注资源占用和费用。
  • 作业监控可能存在采集延迟,不能只凭单个瞬时状态判断故障。
  • 作业异常需要结合事件、日志、镜像拉取、启动命令、存储挂载、节点状态和设备状态一起排查。
  • 长时间运行或高资源占用不一定是异常,需要结合业务预期、租户配额和模型规格判断。
  • 不在文档中写真实作业 ID、实例名称、镜像地址、数据路径、日志内容、租户信息、节点名、集群 ID、资源池 ID、内部指标 key 或测试数据。

配置规则与影响 ​

  • 排队先看资源和调度条件:排队不一定是平台故障,可能是规格、标签、配额或集群容量限制。
  • 失败信息要结合事件:错误码和事件能区分镜像、存储、启动命令、权限和资源不足问题。
  • 运行时长用于发现卡死任务:长时间运行应结合日志、资源利用率和业务预期判断。
  • 资源占用会影响其他用户:大作业集中提交时,应同步关注租户配额和集群水位。

结果校验 ​

检查项成功表现异常时处理
页面加载作业监控图表或列表正常显示检查当前角色的监控权限和所选地域是否开放采集能力
统计范围时间范围、地域和对象数量与排查目标一致清除筛选后逐项恢复条件,确认没有混用不同统计口径
数据新鲜度更新时间落在预期采集周期内到系统设置或监控采集组件核对采集周期、连接和告警
异常关联异常指标能关联到集群、节点、设备或作业保持相同时间范围,到相邻监控页和对象详情交叉核对

常见问题 ​

作业监控没有数据 ​

问题现象:

页面可进入,但图表或列表为空。

可能原因:

  • 所选时间没有任务。
  • 地域未开放采集。
  • 当前角色无指标权限。

处理方式:

  1. 扩大时间范围并重置筛选
  2. 核对地域监控能力
  3. 到相邻监控页确认是否同样无数据。

作业监控更新不及时 ​

问题现象:

页面数据长时间没有变化。

可能原因:

  • 采集周期尚未到。
  • 采集组件异常。
  • 页面缓存未刷新。

处理方式:

  1. 核对更新时间
  2. 检查采集组件和告警
  3. 刷新后用同一时间范围复查。

作业监控与相邻页面数值不一致 ​

问题现象:

同一对象在两个监控页面显示不同数值。

可能原因:

  • 聚合粒度不同。
  • 时间范围或时区不同。
  • 筛选对象不同。

处理方式:

  1. 统一时间范围和时区
  2. 核对聚合口径
  3. 清除筛选后逐项恢复。

无法在关联监控中定位目标对象 ​

问题现象:

点击指标或详情入口后找不到对应对象。

可能原因:

  • 对象已结束或被移除。
  • 角色不可见。
  • 关联标识不一致。

处理方式:

  1. 记录对象名称和时间
  2. 到对应列表核对状态
  3. 联系运营管理员检查可见范围。

异常峰值无法复现 ​

问题现象:

监控中出现峰值,但当前详情已恢复正常。

可能原因:

  • 峰值持续时间短。
  • 采样粒度较粗。
  • 任务已经结束。

处理方式:

  1. 锁定峰值时间段
  2. 对照作业和节点事件
  3. 保留脱敏截图和对象标识。

注意事项 ​

  • 作业名称、镜像地址、数据路径和日志内容可能含敏感信息。

  • 终止作业前确认业务影响和输出文件保留策略。

  • 高频失败作业应进入模板或镜像复盘。

  • 文档示例不得包含真实作业 ID、实例名称、镜像地址、数据路径、日志内容、租户信息、节点名、集群 ID、资源池 ID、内部指标 key 或测试数据。

后续操作 ​

  1. 排队问题核对配额、规格和集群容量。
  2. 失败问题核对镜像、启动命令、存储和事件。
  3. 长时间运行任务进入用量和监控页面评估消耗。