Skip to content

快速部署 ​

本任务通过已授权账号、模型、推理引擎、业务策略和计算方案创建云上模型服务。

场景目标 ​

部署请求按预期资源方案和费用提交,并出现在“我的部署”中。

适用角色 ​

  • 平台用户

开始前准备 ​

  • 已有可用的接入账号、授权地域和可部署模型。
  • 已确定单节点或高可用模式,并明确可接受的费用上限。

操作步骤 ​

Step 1:选择云账号与模型 ​

  1. 进入平台首页,点击左侧导航栏的 "快速部署" 菜单,进入"模型库"页面。
  2. 在左侧"可部署范围"卡片中点击目标云厂商(如"阿里云·华东 2(上海)"),系统将基于该范围筛选匹配的模型。
  3. 在右侧"匹配模型"区域,可通过 "全模型" / "全系列" / "全场景" 下拉 + "搜索" 输入框 + "默认排序" 按钮筛选目标模型。
  4. 找到目标模型行(如 Qwen3-8b),点击右侧 "部署模型" 按钮,进入 Step 2 智能推荐部署页。 Step-1

参数说明 ​

字段名称字段类型示例说明
当前范围标签阿里云 / 华东 2(上海)显示当前已选中的云账号与地域组合
范围筛选 - 云下拉全云必填,按云厂商筛选可部署范围
范围筛选 - 地域下拉全地域必填,按地域筛选可部署范围
云厂商选择卡片单选阿里云·华东 2(上海)必填,选择目标云账号与地域
模型筛选 - 模型下拉全模型选填,按模型名称筛选
模型筛选 - 系列下拉全系列选填,按系列筛选
模型筛选 - 场景下拉全场景选填,按应用场景筛选
搜索框文本Qwen3选填,输入模型名称关键字快速定位
排序下拉默认排序选填,模型列表排序方式
模型选择卡片行Qwen3-8b(阿里云 / 华东 2(上海))必填,单击 "部署模型" 按钮进入部署流程

Step 2:智能推荐部署 ​

  1. 在 Step 1 点击模型的 "部署模型" 按钮后,进入"智能推荐部署"页(页面左上角显示返回箭头 + "智能推荐部署" 标题)。
  2. 页面顶部展示 "已选模型" 信息卡(图标 + 模型名 Qwen3-8b + 系列 Qwen3 + 能力 文本生成 + 版本 1.0.0 + 上下文 128),右上角提供 "部署模式" 单选 Tab(单节点 / 高可用),其中"单节点"已选中并展示 "验证、低并发、成本" 提示。
  3. "推理引擎" 配置区(说明:用哪种推理框架来部署模型),单选目标推理引擎:
    • vLLM(吞吐优先、生态成熟、OpenAI API 兼容,默认选中,紫色高亮)
    • SGLang(复杂推理链路、多轮编排与缓存命中优先)
  4. "业务策略" 配置区(说明:按价格、性能、库存与显卡数量调整候选排序),单选目标业务策略:
    • 经济适用(按小时单价与资源利用率排序,默认选中,紫色高亮)
    • 卓越性能(优先高性能 GPU、高带宽与最新引擎)
    • 现货速达(优先可立即启动的空闲资源)
    • 显卡数量(优先满足多卡并行与扩展需求)
  5. "模型算力匹配方案" 卡片(右上角"推荐"标签 + Top 1 徽标 + "确认部署" 按钮):
    • 标题:阿里云 / cn-shanghai(vllm / ecs.gn6i-c4g1.xlarge)
    • 计算资源:GPU NVIDIA T4 x 1 / CPU / 内存 4C / 15G
    • 费用估算:时估 ¥12.78/小时 / 日估 ¥306.72/天 / 月估 ¥9201.60/月 / 年估 ¥111952.80/年
  6. 确认推理引擎、业务策略与算力方案后,点击 "确认部署" 按钮提交部署任务,部署完成后可在 "我的部署" 列表中查看状态。 Step-2

参数说明 ​

字段名称字段类型示例说明
部署模式单选 Tab单节点(验证、低并发、成本) / 高可用必填,选择部署架构模式
推理引擎单选卡片vLLM(吞吐优先、生态成熟、OpenAI API 兼容)必填,选择模型推理框架
业务策略单选卡片经济适用(按小时单价与资源利用率排序)必填,选择算力筛选与排序策略
模型算力匹配方案推荐卡片阿里云 / cn-shanghai / vllm / ecs.gn6i-c4g1.xlarge必填,基于云账号 + 地域 + 引擎 + 策略智能推荐
计算资源 - GPU标签NVIDIA T4 x 1必填,GPU 型号与数量
计算资源 - CPU / 内存标签4C / 15G必填,CPU 核数与内存大小
费用估算 - 时估数值¥12.78/小时必填,每小时费用
费用估算 - 日估数值¥306.72/天必填,每天费用
费用估算 - 月估数值¥9201.60/月必填,每月费用
费用估算 - 年估数值¥111952.80/年必填,每年费用

完成检查 ​

用途: 以下检查是当前功能任务的退出条件,用于判断操作结果是否可观察、可复核,以及是否可以继续当前场景的下一步。它不是操作步骤的重复;任一项不满足时,请按下方“常见失败分支”继续排查。

检查项通过标准
1账号、地域、模型、引擎和计算方案均可选择。
2已核对费用和使用范围后提交请求。
3“我的部署”出现新记录。

常见失败分支 ​

现象优先检查
选不到模型或计算方案账号授权、地域、资产兼容、配额和当前容量
创建部署失败必填项、费用方案、云账号状态和事件详情

操作手册 ​

查看“快速部署”的完整步骤、校验规则和常见问题