News
时间:2026-09-08
近日,云原生分布式推理开源项目 llm-d 正式纳入沐曦曦云 C系列GPU 支持,这也是 llm-d 官方支持的加速器名单中首次纳入国产 GPU。
llm-d 是由Red Hat发起,构建在 vLLM 、SGLang等推理引擎与 Kubernetes 之上的云原生分布式推理框架,目前已交由CNCF(Cloud Native Computing Foundation,Linux旗下云原生计算基金会)托管。项目聚焦大模型服务化落地中的前缀缓存感知路由、负载感知调度与 Prefill/Decode 分离等关键能力,将单服务器节点的推理引擎转换为多节点协同的“生产级分布式推理系统”,诞生至今已获得超过 4400 个 GitHub Star,英伟达 GPU、谷歌 TPU、AMD GPU、英特尔 XPU 等主流算力平台均已在该社区中形成各自的部署指南。
沐曦股份此次与密瓜智能(Dynamia AI)合作,率先完成曦云C系列 GPU 在 llm-d 社区的完整适配,实现了基于曦云C系列GPU硬件环境下的单卡、多卡及 Prefill/Decode 分离推理部署验证。
大模型从可运行到可规模化服务,算力芯片本身只是起点,芯片能否顺畅接入云原生推理调度体系才是决定落地效率的关键。此前,此类国际开源项目的默认配置多以国外芯片为假设前提,国产 GPU 即便已能运行主流推理引擎,用户若要复用社区成熟部署方案,仍需自行摸索大量隐性适配细节。
本次适配打通的正是这一环节,为曦云 C系列 GPU提供了三条开箱即用的部署路径:
同时,团队在曦云 C系列 GPU上完成了 llm-d 推理路由器的实测性能标定,Qwen3-14B 单卡配置下测得峰值 Prefill 吞吐 5773 tokens/s,DeepSeek-R1-Distill-Llama-70B 八卡配置下测得 5468 tokens/s,两组数据已并入 llm-d 社区公开标定矩阵,国内用户在沐曦平台部署时可直接引用来自真实硬件的性能基线。适配所需的 vLLM-MetaX 推理镜像已通过公开镜像仓库发布,用户可直接获取使用。
本次 llm-d 适配中,沐曦股份提供了完整的测试运行环境、vLLM-MetaX 推理镜像及 MXMACA 软件栈层面的技术支持。
密瓜智能则承担了 llm-d 侧的功能实现、端到端验证及与上游社区的持续沟通协作,推动方案通过国际社区技术评审。在 llm-d 社区加速器维护者名单中,已同步登记了分别来自双方的两位维护者,后续将共同负责该路径的长期维护与迭代。
未来,沐曦股份将持续推进GPU硬件与全栈软件技术的迭代升级,深化与密瓜智能等云原生技术企业的生态协作,推动国产算力在国际主流开源基础设施项目中的深度参与,完善"国产芯片—云原生底座—产业落地"的完整技术链条,为人工智能技术在各行各业的规模化落地提供坚实支撑。
llmd 项目主页:
https://github.com/llmd/llmd
本次适配 PR:
https://github.com/llmd/llmd/pull/2308
加速器支持说明:
https://github.com/llmd/llmd/blob/main/docs/gettingstarted/accelerators.md
P/D 分离部署指南:
https://github.com/llmd/llmd/blob/main/guides/pddisaggregation/README.md