News
时间:2026-09-18
近日,沐曦股份已与国际开源社区LMCache达成合作。此次合作,双方基于开源行业主流的“Upstream First”(上游优先)原则,沐曦自研软件栈MXMACA正式加入LMCache官方原生支持体系,相关代码也已成功合入LMcahe官方核心代码库与主线项目。
未来,双方将共同推动大模型推理场景下 KV Cache(键值缓存)技术在沐曦 GPU 平台上的应用与优化。
随着大模型应用规模的持续扩大,推理成本已成为制约大模型落地的关键因素之一。KV Cache 能够有效降低这一成本。
KV Cache 是 LLM 模型在推理阶段的一种基础优化技术,核心思路是“以存储换计算”。当模型逐字生成文本时,需要反复计算历史内容的注意力信息。如果没有 KV Cache,生成第 N 个字时就要把前面 N-1 个字重新算一遍,计算量呈平方级增长。KV Cache 的做法是:把已经算过的N-1个字 Key和 Value (Key为用于相似度匹配的特征向量,Value为承载token语义信息、用于加权聚合的特征向量) 向量存下来,生成新 token 时只计算当前的第N个字,然后从缓存里读取历史的 K 与 V 一起参与注意力计算。
LMCache 本质上则是一个 KV Cache 的管理系统,专门优化大模型推理性能。
当大模型在生成回答时,需要把处理过的上下文KV Cache暂存在 GPU 显存里;显存有限,长文本或高并发时容易引发崩溃。LMCache 的核心思路是:将KV Cache高效移出GPU,并在不同请求、不同推理实例、不同存储层之间复用,升级为可存储、可迁移、可调度的资源,避免重复计算,显著降低推理延迟并提升吞吐量 。
如果说KV Cache 让单次对话生成速度变快,LMCache 的核心目标是保证多轮对话、重复前缀、RAG 文档块等复杂场景中的重复内容不再重复计算,实现规模化加速。前者是模型推理的标配,后者是在此基础上进一步面向企业业级工程项目的部署成本。
LMCache最初是由芝加哥大学研究团队发起的开源项目,目前已成为全球主流推理生态的核心项目,开源社区已有超过 220位贡献者、30 多家行业合作伙伴。
此次与LMCache合作,沐曦股份坚定践行“ Upstream First ”原则。不同于传统的“下游分支适配”( Downstream Fork )模式,沐曦股份并没有将适配代码闭源维护或延后合并,而是将MXMACA平台的原生支持直接贡献至上游,合并至 LMCache 官方核心代码库与主线项目。这一做法的核心价值体现在:
此次与LMCache社区的深度协作,是沐曦股份持续拥抱开源、融入全球AI基础设施生态的重要实践。
面向未来,沐曦股份与 LMCache 社区的合作将建立长期、持续的协作机制:
通过践行“Upstream First”原则,沐曦股份将持续推进自身的GPU架构优势与社区最前沿的推理优化技术紧密结合,为用户提供更加完善、可持续演进的软硬件协同能力。
参考:https://github.com/LMCache/LMCache/pull/4606
RoadMap: https://github.com/LMCache/LMCache/issues/4833