News

新闻中心

时间:2026-09-04

大模型浪潮奔涌至今,大家聊架构演进、聊Agent应用、聊推理性能,却常常忽略了支撑一切的底层基石——GPU算子


从GEMM到FlashAttention,每一个大模型的吞吐上限、延迟表现,最终都锚定在算子的实现质量上。而随着国产算力生态的快速崛起,异构硬件架构、多样软件栈并存的局面,让算子开发从“单一平台写代码”变成了“跨生态做适配”,对开发者的底层能力提出了全新的要求。


我们在和大量一线开发者、高校师生交流中发现,很多人都卡在相似的能力断层上:


  • 会调用,不会开发:熟练使用PyTorch算子接口,却从未亲手实现过一个GPU算子,对底层硬件执行逻辑一知半解,遇到性能瓶颈缺乏系统的调优方法论;


  • 会单一工具,不懂本质:只接触过一种算子开发工具,不理解不同工具背后的编程范式与适用边界,无法根据硬件特性、算子类型做技术选型,难以建立算子开发的本质认知;


  • 会单一平台,不会异:仅在单一硬件环境下有开发经验,面对国产异构计算平台时缺乏适配经验,想入局国产算力赛道却找不到系统的切入路径。


针对这一现状,沐曦股份联合AI Infra开源社区、九源开源社区、GitLink开源平台、DataWhale开源学习社区、启悟学习社区,正式推出「多范式算子开发实战营」。以“建立算子开发本质认知,掌握异构平台适配能力”为核心,带你系统对比九齿、Triton、TileLang多种不同编程范式的算子开发工具,完成从基础算子、复杂算子到性能优化、异构适配的全链路实战,补齐国产算力时代的算子开发能力短板。


为解决开发者实战算力不足的痛点,沐曦股份将为所有学员提供免费GPU算力券,全程可使用沐曦C系列GPU环境完成所有开发、编译与性能测试实验。学员无需自备显卡,不用折腾本地环境,打开浏览器即可上手实操,真正做到开箱即练。


实战营 9月4日报名开启,9月13日正式开营


即刻报名,锁定你的实战营席位:

https://developer.metax-tech.com/activities/29


不同编程范式的横向学习,建立算子开发本质认知


课程将系统拆解九齿、Triton、TileLang三种算子开发工具的设计思想、核心编程范式与适用场景,从底层逻辑讲透工具“跨硬件快速验证算子、降低跨平台迁移成本”的核心价值。你将学会根据硬件架构、算子类型、开发目标选择最合适的技术路径,建立跨工具、跨平台的迁移能力,而不是只会套用单一工具的语法。


扎根国产异构生态,全程真实硬件环境实战


实战营课程全程基于九源软件栈与沐曦GPU、MXMACA软件栈的联合开源生态,完整复现国产异构计算环境下的算子开发与适配流程。


你将亲手在真实的国产GPU环境中,实践不同编程范式工具的硬件适配过程,直观对比不同方案在国产平台上的开发效率与性能表现,真正掌握异构平台算子开发的方法论,抢占国产算力生态的人才先机。


全链路能力覆盖:从算子实现到性能优化


课程采用循序渐进的路径设计,完整覆盖算子开发的全技术链路:


1. 入门:基础算子实现,快速建立对应编程范式的开发思维

2. 进阶:GEMM、FlashAttention等大模型核心复杂算子深度拆解

3. 优化:McProfiling性能分析工具链实战,瓶颈定位与系统调优方法

4. 前沿:AI Agent辅助算子开发,从代码生成、正确性验证到性能优化的完整实践


从“写出能跑的算子”到“写出高性能的算子”,一步到位构建全栈算子开发能力。


学完你将收获


1. 全局产业视野:吃透九源软件栈、沐曦GPU与MXMACA软件栈的架构设计与开源生态,建立对国产异构算力体系的完整认知;


2. 多范式开发能力:系统掌握九齿、Triton、TileLang三类算子开发工具的核心用法,具备面向场景的技术选型能力;


3. 复杂算子落地能力:深度理解GEMM、FlashAttention等核心算子的计算本质,具备独立设计与实现复杂算子的能力;


4. 性能调优思维:熟练使用McProfiling定位算子瓶颈,掌握国产GPU架构下的性能优化方法与工程实践;


5. 前沿方法实践:完整体验AI Agent辅助算子开发流程,理解人机协作的最佳实践与能力边界;


6. 可落地项目成果:完成结业项目,产出可验证、可复用的算子开发作品,可直接用于简历背书或开源社区贡献。


适合人群


有GPU编程基础的开发者:参加过TileLang训练营、InfiniTensor大模型与人工智能系统训练营,希望系统学习多种算子开发范式、掌握异构平台算子适配能力


AI系统/Infra工程师:从事大模型推理、训练框架或AI编译器相关工作,想深入底层算子开发,构建全栈技术能力


高校计算机相关专业师生:想补全AI底层系统知识,积累国产GPU算子开发项目经验,为科研、竞赛、求职增加竞争力


国产算力生态从业者与爱好者:希望切入九源/沐曦MXMACA生态,参与国产异构平台算子与编译生态建设


课程学习路径


实战营为期约3周,采用「理论讲解+动手实战+项目结业」的模式,循序渐进提升能力:


阶段一:生态全局与环境准备


系统性讲解九源软件栈、MXMACA软件栈的架构设计、组件定位与开源生态路线图;完成沐曦GPU算力领取、环境搭建与基础工具上手,建立国产异构计算的全局认知。


阶段二:多范式认知与基础实践


深入讲解九齿、TileLang的核心编程范式,横向对比多种不同编程范式的算子开发工具的设计理念与适用场景;通过向量加法、ReLU等基础算子实现,亲身体验不同开发范式的编程体验与效率差异。


阶段三:复杂算子与性能优化


深度拆解GEMM、FlashAttention等大模型核心算子的计算本质与实现流程;学习McProfiling性能分析工具链,完成算子瓶颈定位与优化实践;对比不同开发范式在同一算子上的实现差异、性能差异与开发效率。


阶段四:前沿方法与结业项目


分享AI Agent辅助算子开发的完整实践,探索人机协作提升开发效率的新范式;最终完成结业项目:在go-llama-go开源仓库中选择至少2种技术栈,实现并优化2个以上算子并集成至Llama推理中,产出完整实战成果。


开源课程


课程所有讲义、代码与实验项目均完全开源,免费面向所有开发者开放。


开源课程仓库:https://www.gitlink.org.cn/ccf-ai-infra/gollamago


沐曦GPU算力券将在学员报名成功后统一发放,全程免费使用。


国产算力的竞争,正在从硬件规格的比拼,转向底层软件生态的赛跑。算子开发作为AI软件栈的核心底座,是每一个想深入AI Infra领域的开发者都绕不开的一课。


如果你不想只停留在“算子调用者”的层面,想真正扎进底层硬件逻辑,掌握多范式、跨平台的算子开发与异构适配能力,欢迎加入这次实战营。


不要等“准备好”再出发,从第一个亲手开发的算子开始,一起成为国产算力生态的建设者。


扫码报名



  • 商务合作 Business@metax-tech.com
  • 投资者联系 ir@metax-tech.com