Skip to content

场景概览 - 异构卡纳管:推理模板构建 ​

本场景介绍如何把模型、推理框架、启动参数和资源规格组合成可复用的部署模板。对于 4 张 NPU 卡,模板负责限定可选卡型、卡数和启动方式。

适用角色 ​

  • 运营管理员
  • 推理平台维护人员

场景目标 ​

  • 完成模型配置、推理框架和显存测算,创建一个能够选择 NPU 资源规格的推理模板。
  • 明确模板使用 1 卡、2 卡还是 4 卡。
  • 用户可以基于模板发起模型部署。

场景流程 ​

主线: 维护模型配置 → 确认推理框架 → 校验显存测算 → 组合推理模板 → 验证 1/2/4 卡参数 → 发布给用户

阶段核心结果
1. 准备依赖模型配置、框架、显存因子、镜像、存储和资源规格可用
2. 组合模板启动命令、环境变量和健康检查形成可复用配置
3. 验证卡数模板规格与单卡、2 卡或 4 卡并行参数一致
4. 发布使用测试部署通过,目标用户能看到并选择模板

开始前准备 ​

  • 已完成 NPU 卡型、集群、规格指标和资源规格配置。
  • 已准备模型配置、推理框架、显存测算配置和可用镜像。
  • 已确认多卡部署所需的并行参数与驱动环境。

推荐阅读顺序 ​

  1. 异构卡纳管:算力接入
  2. 构建 NPU 推理模板
  3. 部署模型并检查状态

文档索引 ​

文档说明
构建 NPU 推理模板维护模型、框架和显存测算后,选择资源规格并配置启动参数

完成检查 ​

用途: 以下检查是本场景的退出条件,用于判断是否已经取得可观察、可复核的结果,以及是否可以进入下一场景。它不是操作步骤的重复;任一项不满足时,请返回对应功能文档的“常见失败分支”排查。

检查项通过标准
1模型配置、框架、显存测算和模板状态均可用。
2模板能够选择目标 NPU 规格。
3使用模板创建实例时,卡数和并行参数符合预期。