Skip to content

构建 NPU 推理模板 ​

场景目标 ​

模板正确关联框架、模型、运行参数和单卡或 4 卡 NPU 方案。

适用角色 ​

  • 平台运营方

开始前准备 ​

  • 准备模型配置、框架、镜像、资源规格、端口和存储要求。
  • 明确 4 张卡用于一个分布式实例,还是拆分为多个较小实例。

功能入口 ​

  • 角色:运营管理员
  • 菜单:AI基础设施 > On-Prem > 模板 > 推理模板
  • 路由:/powerone/fast-build-v2/inference-templates

操作步骤 ​

  1. 进入模型配置,确认模型名称、类型、存储位置和状态可用。

确认模型配置可供模板选择

  1. 进入推理框架,确认框架版本、运行镜像和目标 NPU 兼容。
  2. 进入显存测算,根据参数规模、精度和并行方式确认单卡及多卡显存需求。

按模型精度和规模核对显存测算

  1. 点击 新增,填写模板名称和用途,选择已维护的模型配置和推理框架。
  2. 选择包含目标 NPU 型号、卡数和显存容量的资源规格。
  3. 配置启动命令、环境变量、端口、健康检查、模型路径,以及页面支持的 Extra parameters。
  4. 多卡模板中设置与 2 卡或 4 卡一致的并行参数。
  5. 保存模板;只有在模型、框架、加速卡关联、显存参数和启动配置验证通过后,才将模板设置为 Available,并通过测试部署验证镜像、驱动、显存和启动参数。

推理模板列表

4 张 NPU 卡的模板策略 ​

  • 建议分别建立 1 卡、2 卡和 4 卡模板,避免用户在启动参数与规格卡数之间产生不一致。
  • 4 卡模板应明确是单节点 4 卡还是多节点部署;不要仅凭总卡数判断可行。
  • 模板发布前先用最小模型验证驱动、运行时、集合通信和健康检查。

完成检查 ​

用途: 以下检查是当前功能任务的退出条件,用于判断操作结果是否可观察、可复核,以及是否可以继续当前场景的下一步。它不是操作步骤的重复;任一项不满足时,请按下方“常见失败分支”继续排查。

检查项通过标准
1模型、框架、显存测算和模板记录可见且状态正常。
2模板引用的资源规格包含正确的 NPU 型号和数量。
3测试部署能够进入创建或运行状态。

常见失败分支 ​

现象优先检查
选不到框架或模型状态、地域、兼容性和模板前置项
4 卡实例无法启动资源规格、分布式参数、空闲卡数、端口和存储
模板一直不可用模型或框架状态、加速卡关联、显存系数、必填项,以及是否已显式设置为 Available
Extra parameters 导致启动失败参数名称、值格式、框架支持情况,以及该参数是否需要专业服务校验

操作手册 ​

查看推理模板完整字段说明