场景概览 - 异构卡纳管:推理模板构建
本场景介绍如何把模型、推理框架、启动参数和资源规格组合成可复用的部署模板。对于 4 张 NPU 卡,模板负责限定可选卡型、卡数和启动方式。
适用角色
- 运营管理员
- 推理平台维护人员
场景目标
- 完成模型配置、推理框架和显存测算,创建一个能够选择 NPU 资源规格的推理模板。
- 明确模板使用 1 卡、2 卡还是 4 卡。
- 用户可以基于模板发起模型部署。
场景流程
主线: 维护模型配置 → 确认推理框架 → 校验显存测算 → 组合推理模板 → 验证 1/2/4 卡参数 → 发布给用户
| 阶段 | 核心结果 |
|---|---|
| 1. 准备依赖 | 模型配置、框架、显存因子、镜像、存储和资源规格可用 |
| 2. 组合模板 | 启动命令、环境变量和健康检查形成可复用配置 |
| 3. 验证卡数 | 模板规格与单卡、2 卡或 4 卡并行参数一致 |
| 4. 发布使用 | 测试部署通过,目标用户能看到并选择模板 |
开始前准备
- 已完成 NPU 卡型、集群、规格指标和资源规格配置。
- 已准备模型配置、推理框架、显存测算配置和可用镜像。
- 已确认多卡部署所需的并行参数与驱动环境。
推荐阅读顺序
文档索引
| 文档 | 说明 |
|---|---|
| 构建 NPU 推理模板 | 维护模型、框架和显存测算后,选择资源规格并配置启动参数 |
完成检查
用途: 以下检查是本场景的退出条件,用于判断是否已经取得可观察、可复核的结果,以及是否可以进入下一场景。它不是操作步骤的重复;任一项不满足时,请返回对应功能文档的“常见失败分支”排查。
| 检查项 | 通过标准 |
|---|---|
| 1 | 模型配置、框架、显存测算和模板状态均可用。 |
| 2 | 模板能够选择目标 NPU 规格。 |
| 3 | 使用模板创建实例时,卡数和并行参数符合预期。 |