News

Date: 2026-09-08

近日,云原生分布式推理开源项目 llm-d 正式纳入沐曦曦云 C系列GPU 支持,这也是 llm-d 官方支持的加速器名单中首次纳入国产 GPU。


llm-d 是由Red Hat发起,构建在 vLLM 、SGLang等推理引擎与 Kubernetes 之上的云原生分布式推理框架,目前已交由CNCF(Cloud Native Computing Foundation,Linux旗下云原生计算基金会)托管。项目聚焦大模型服务化落地中的前缀缓存感知路由、负载感知调度与 Prefill/Decode 分离等关键能力,将单服务器节点的推理引擎转换为多节点协同的“生产级分布式推理系统”,诞生至今已获得超过 4400 个 GitHub Star,英伟达 GPU、谷歌 TPU、AMD GPU、英特尔 XPU 等主流算力平台均已在该社区中形成各自的部署指南。


沐曦股份此次与密瓜智能(Dynamia AI)合作,率先完成曦云C系列 GPU 在 llm-d 社区的完整适配,实现了基于曦云C系列GPU硬件环境下的单卡、多卡及 Prefill/Decode 分离推理部署验证。


大模型从可运行到可规模化服务,算力芯片本身只是起点,芯片能否顺畅接入云原生推理调度体系才是决定落地效率的关键。此前,此类国际开源项目的默认配置多以国外芯片为假设前提,国产 GPU 即便已能运行主流推理引擎,用户若要复用社区成熟部署方案,仍需自行摸索大量隐性适配细节。


本次适配打通的正是这一环节,为曦云 C系列 GPU提供了三条开箱即用的部署路径:



  • 优化基线单卡路:以 Qwen3-14B、张量并行 TP=1 为配置,验证曦云 C系列 在 llm-d 标准模型服务栈下的基础推理能力。


  • 优化基线八卡路径:以 DeepSeekR1-Distill-Llama-70B、张量并行 TP=8 为配置,验证单机八卡下的大参数量模型服务能力。


  • Prefill/Decode 分离路径:以 Prefill + 1 Decode 拓扑运行 Qwen3-14B,基于 vLLM NixlConnector 与 llm-d 路由 Sidecar 打通 KV 缓存跨实例传输链路。P/D 分离将推理过程中计算特征迥异的两个阶段拆分至不同实例分别优化,是当前提升大模型推理资源利用率的关键技术方向之一。该路径在实现上通过NIXL适配并优化的MIXL,大幅提升传输效率,并降低用户落地门槛。



同时,团队在曦云 C系列 GPU上完成了 llm-d 推理路由器的实测性能标定,Qwen3-14B 单卡配置下测得峰值 Prefill 吞吐 5773 tokens/s,DeepSeek-R1-Distill-Llama-70B 八卡配置下测得 5468 tokens/s,两组数据已并入 llm-d 社区公开标定矩阵,国内用户在沐曦平台部署时可直接引用来自真实硬件的性能基线。适配所需的 vLLM-MetaX 推理镜像已通过公开镜像仓库发布,用户可直接获取使用。


本次 llm-d 适配中,沐曦股份提供了完整的测试运行环境、vLLM-MetaX 推理镜像及 MXMACA 软件栈层面的技术支持。


密瓜智能则承担了 llm-d 侧的功能实现、端到端验证及与上游社区的持续沟通协作,推动方案通过国际社区技术评审。在 llm-d 社区加速器维护者名单中,已同步登记了分别来自双方的两位维护者,后续将共同负责该路径的长期维护与迭代。


未来,沐曦股份将持续推进GPU硬件与全栈软件技术的迭代升级,深化与密瓜智能等云原生技术企业的生态协作,推动国产算力在国际主流开源基础设施项目中的深度参与,完善"国产芯片—云原生底座—产业落地"的完整技术链条,为人工智能技术在各行各业的规模化落地提供坚实支撑。


项目链接


llmd 项目主页

https://github.com/llmd/llmd


本次适配 PR

https://github.com/llmd/llmd/pull/2308


加速器支持说明

https://github.com/llmd/llmd/blob/main/docs/gettingstarted/accelerators.md


P/D 分离部署指南

https://github.com/llmd/llmd/blob/main/guides/pddisaggregation/README.md

  • Business CooperationBusiness@metax-tech.com
  • Investor Relationsir@metax-tech.com