Skip to content

模型库 ​

本任务把元模型、云侧部署点、云上模型、计算方案和输出协议组合为可部署的模型资产。

场景目标 ​

平台用户能在快速部署中选择该模型,部署后能获得正确的 API 定义。

适用角色 ​

  • 平台运营方

开始前准备 ​

  • 已准备元模型、云账号、云地域、推理镜像和推理框架。
  • 已确认云上模型标识、兼容计算方案和输出协议。

操作步骤 ​

添加模型 ​

  1. 进入平台首页,点击左侧导航栏的 "部署资产 > 模型库" 菜单,进入模型库页面。
  2. 点击页面右上角的 "添加模型" 按钮,进入添加模型流程(3 步)。 模型库
  3. Step 1:元模型 / 上架版本:
    • "元模型筛选":在筛选器(全部作者 / 全部类型 / 关键字搜索)中定位目标元模型,已选元模型会作为标签展示在筛选器下方,可点击标签删除。
    • "元模型选择":在元模型列表中单选目标元模型(如 Qwen3-8b),右侧展示元模型详情,包括模态、当前已开放的能力元数据、Token 限制、兼容协议、模型系列、作者、子类型和描述。
    • "上架版本":填写 "版本"(如 1.0.0)与 "版本描述"(富文本)。
    • 点击 "下一步"。 元模型/上架版本
  4. Step 2:部署配置:
    • "云侧部署点":左侧管理部署点(每个部署点绑定一个云平台 + 地域),可点击 "+ 添加部署点" 新增。 添加云侧部署点
    • "云上模型":点击 "指认云上模型" 按钮,配置元模型与云账号下的云上模型(如 aliyun-wh-dev / Qwen3-8B),点击 "保存"。 指认云上模型
    • "算力配置":点击 "选择算力方案" 按钮,单选目标模型框架(如 Qwen3-8B / vllm / v1.0 / eas-registry-vpc.cn-shanghai.cr.aliyuncs.com/pai-eas/vllmv:0.9.1-modelgallery)与部署规格(如 ecs.gn6i-c4g1.xlarge / NVIDIA T4 x 1 / 4 核 / 15GB / CNY12.78/Hour),点击 "保存"。 选择算力方案
    • "输出配置":点击 "添加输出配置" 按钮,配置请求 URL(部署后自动生成,模板 {request_url})、请求方法(如 POST)、请求头(Content-Type: application/json / Authorization: Bearer {api_key})、请求参数(max_tokens: 1024 / messages: [{"role":"user","content":"hello"}])与多语言代码样例(curl / python / java / go / nodejs / php / ruby),点击 "保存"。 添加输出配置
    • 点击 "下一步"。
  5. Step 3:确认配置:核对模板整体配置信息(元模型信息 / 能力与接入约束 / 元模型资料 / 部署配置:云上模型 + 算力配置 + 输出配置),确认无误后点击 "提交" 完成模型添加;如需修改,点击 "上一步" 返回对应步骤。 确认配置

参数说明 - 元模型/上架版本(Step 1) ​

字段名称字段类型示例说明
元模型单选Qwen3-8b(唯一标识 qwen/qwen3-8b)必填,选择基础元模型
上架版本 - 版本文本1.0.0必填,模型上架版本号
上架版本 - 版本描述富文本—选填,说明该版本更新内容

参数说明 - 部署配置(Step 2) ​

字段名称字段类型示例说明
云侧部署点列表阿里云·华东2(上海)必填,每个部署点绑定一个云平台 + 地域
云账号下拉选择aliyun-wh-dev必填,模型部署使用的云账号
云上模型下拉选择Qwen3-8B必填,指认到云账号下的云上模型
模型框架单选Qwen3-8B / vllm / v1.0 / eas-registry-vpc.cn-shanghai.cr.aliyuncs.com/pai-eas/vllmv:0.9.1-modelgallery必填,模型框架与运行时版本
部署规格单选ecs.gn6i-c4g1.xlarge / NVIDIA T4 x 1 / 4 核 / 15GB / CNY12.78/Hour必填,GPU 型号 / 数量 / CPU 核数 / 内存
请求 URLURL{request_url}(部署后生成)必填,模型调用端点
请求方法下拉选择POST必填,HTTP 请求方法
请求头 - Content-Type文本application/json必填,请求内容类型
请求头 - Authorization文本Bearer {api_key}必填,访问凭证
请求参数 - max_tokens数值1024必填,最大生成 Token 数
请求参数 - messages数组[{"role":"user","content":"hello"}]必填,对话消息内容

完成检查 ​

用途: 以下检查是当前功能任务的退出条件,用于判断操作结果是否可观察、可复核,以及是否可以继续当前场景的下一步。它不是操作步骤的重复;任一项不满足时,请按下方“常见失败分支”继续排查。

检查项通过标准
1元模型、部署点、云上模型和计算方案相互兼容。
2输出协议和示例不包含真实凭证。
3平台用户能在快速部署中看到并选择该资产。

常见失败分支 ​

现象优先检查
部署点没有可选模型或规格云账号同步、地域、模型可用性和规格兼容性
平台用户看不到模型资产资产状态、租户授权、业务地域授权和发布范围

操作手册 ​

查看“模型库”的完整字段、校验规则和常见问题