Skip to content

模型部署与管理 ​

模型下载与市场 ​

问:模型如何下载和部署? ​

答:首先,为所有客户提供共享存储,例如 NAS 或本地路径,并由运营方统一管理。该存储可以挂载到由 Kubernetes 管理的 NPU/GPU 节点集群。运营方用户可以通过界面从 Hugging Face 或 ModelScope 下载模型,也可以在后台终端下载模型并存放到指定路径。在部署任务启动前,共享存储会自动挂载到 Pod 实例。随后,用户可以通过运营方管理的模型模板启动 Kubernetes Job 或 Deployment,也可以提供指定命令来完成模型部署。

问:新发布模型进入模型市场是否有 SLA? ​

答:有。模型由运营方使用推理模板进行封装。推理模板包括 vLLM、SGLang、MindIE 等推理基础镜像、资源规格、启动命令和其他必要参数。封装后的模型会在后台测试通过后再发布。

部署方式 ​

问:是否会为 GPU 分配创建 profile? ​

答:是。平台会创建用于 Deployment 或 Job 的 Kubernetes YAML 文件,并在其中定义 GPU 分配方式。

问:自助部署如何实现? ​

答:客户可以通过界面进行自助模型部署,方式包括使用运营方管理的模型模板创建 Kubernetes Job 或 Deployment,或提供指定命令。

模型管理与推理能力 ​

问:平台的推理管理能力如何?是否支持模型版本管理、灰度发布、动态批处理? ​

答:平台支持模型快速部署模板管理,支持模型版本管理、发布,同时支持将多来源(可以是自部署,也可以是第三方来源)模型聚合,可将同类型模型进行聚合,并根据分发策略进行使用,支持熔断、Failback等。

问:平台的模型管理功能如何?支持哪些推理加速技术?预置模型库的规模有多大? ​

答:AGIOne 将主流模型部署知识沉淀为可复用模型模板,模板包含模型规格、推荐算力、推理引擎、上下文能力等配置,并支持官方模板导入和自定义模板。推理加速包括2部分,一部分是部署时,通过启用推理框架(如vLLM、SGLang等)的推理加速模块进行加速,另一部分,在模型聚合侧(尤其是多模型实例时),可根据不同实例的事实任务负载数量及吞吐量、时延等信息,动态调整推理请求分发,以达到提升资源利用率及加速效果。主要包括常见开源的模型,包括DeepSeek、千问等,不断积累为模版。

问:数据功能覆盖哪些环节?是否具备增量训练和模型微调的能力? ​

答:不具备。

模型更新流程 ​

问:模型频繁更新时,流程是什么? ​

答:平台提供模型服务。

对于单个模型,平台提供固定的 model ID、API key 和 endpoint。模型可以在不同版本之间管理,同时保留相同的 API key 和 endpoint。新的模型版本可以先在后台部署并测试。测试完成后,可以使用新的模型 endpoint、model ID 和 API key 发布。

问:替换现有模型需要哪些步骤? ​

答:对于聚合模型,平台提供固定的 model ID、API key 和 endpoint,并可组合多个单模型,分别启用或禁用。新模型版本部署后,可以加入聚合模型,用户也可以禁用旧版本。