News

Date: 2026-08-13

阿里千问开源超大规模 MoE 模型 Qwen3.8-2.4T-A95B,沐曦股份与众智FlagOS合作,率先完成对该模型的Day 0 适配,实现基于沐曦GPU硬件环境下的推理部署验证。这充分展示出了沐曦股份软硬件协同的兼容优势与生态合作的协同作用。


本次发布的 Qwen3.8-2.4T-A95B 是阿里千问开源模型系列中规模最大、能力最强的一代,首次将 Qwen-Max 级别的模型开放出来。主要特性:


  • 超大规模 MoE 架构,总参数 2.4T,激活参数 95B,纯文本模型


  • 编程、专业工作、科研、长程智能体任务显著提升;支持 reasoning_effort 调节推理深度,preserve_thinking 保留历史推理


  • 原生 262,144 tokens,可扩展至 1,010,000;提供 BF16 / FP8 权重,兼容 vLLM、SGLang、TokenSpeed等


在 Coding Agent 相关基准测试中,Qwen3.8-Max 相比 Qwen3.7-Max 有明显提升:Terminal Bench 2.1 从 74.5 升至 86.6,SWE-bench Pro 从 60.6 升至 67.7,接近 Opus 4.8(69.2),PaperBench 从 64.8 升至 93.0,并超过 Opus 4.8(80.3)。


MXMACA软件栈是沐曦GPU从“可用” 进阶为 “好用、易用”的核心基石。作为连接硬件算力与上层应用生态的核心枢纽,MXMACA软件栈全链路覆盖底层驱动、用户态接口、MXCC编译器、算子深度适配及主流训练/推理框架对接,原生兼容国际主流生态,适配 PyTorch、TensorFlow、vLLM与SGLang等 40 余种主流 AI 框架,支持 500+ AI 模型稳定运行,大幅缩短传统模型适配周期。


目前,FlagOS已经完成针对Qwen3.8-2.4T-A95B开源模型的精度对齐与部署验证,开发者可直接获取开箱即用方案。未来,沐曦股份将持续推进GPU硬件与全栈软件技术的迭代升级,深化与FlagOS等人工智能企业的生态协作,以Day 0适配为标准,持续完善“国产芯片-国产大模型-产业落地”的完整技术链条。共同打造从底层算力到上层应用的无缝衔接生态,为人工智能技术在各行各业的规模化落地提供坚实支撑。


开发者速用指南


FlagOS 为 Qwen3.8-2.4T 提供了沐曦GPU的推理插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL 两种推理框架插件。目前在 FlagOS 推理插件的支持下,沐曦股份完成 Qwen3.8-2.4T 的推理部署及评测验证,业务代码与标准调用接口无需修改。


使用源码安装部署,可参考以下官方文档:


1、vLLM-plugin-FL


GitHub:https://github.com/flagos-ai/vllm-plugin-FL/blob/main/README.md


GitCode:https://gitcode.com/flagos-ai/vllm-plugin-FL/blob/main/README.md


2、SGLang-plugin-FL


GitHub:https://github.com/flagos-ai/sglang-plugin-FL/blob/main/README.md


GitCode:https://gitcode.com/flagos-ai/sglang-plugin-FL/blob/main/README.md


FlagOS 安装部署


快速安装(以 vLLM 为例)


安装步骤如下:


Shell
 # 1. 安装 vLLM
 git clone git@github.com:vllm-project/vllm.git
 cd vllm 
 git checkout v0.24.0
 VLLM_TARGET_DEVICE=empty pip install -v --no-build-isolation  --no-deps 

 # 2. 安装 vllm-plugin-FL
 git clone https://github.com/flagos-ai/vllm-plugin-FL
 cd vllm-plugin-FL
 git checkout v0.3.0-dev
 pip install --no-build-isolation -e .

 # 3. 安装 FlagGems 算子库
 git clone https://github.com/flagos-ai/FlagGems
 cd FlagGems && git checkout v5.3.0
 pip install --no-build-isolation -e .

 # 4. (可选) 安装 FlagTree 跨芯编译器

 # 5. (可选) 安装 FlagCX 跨芯通信库
 # 详见 https://github.com/flagos-ai/FlagCX



运行推理


以下为沐曦平台 INT8 版本的示例,模型路径、tensor_parallel_size、max_num_batched_tokens、max_num_seqs 等参数需按卡数与服务配置调整:


Python
from vllm import LLM, SamplingParams
prompts = ["请介绍下阿里巴巴开源最新模型QWen3.8"]
sampling_params = SamplingParams(max_tokens=10, temperature=0.0)
llm = LLM(
    model="FlagRelease/Qwen3.8-2.4T-A95B-INT8-metax-FlagOS", 
    max_num_batched_tokens=8192,
    max_num_seqs=32,
    tensor_parallel_size=16,
    pipeline_parallel_size=2)
outputs = llm.generate(prompts, sampling_params)
for output in outputs:
    print(f"Prompt: {output.prompt!r}")
    print(f"Generated: {output.outputs[0].text!r}")


双方合作的模型适配版本链接见下,欢迎体验!


魔搭平台https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-INT8-metax-FlagOS


HuggingFacehttps://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-INT8-metax-FlagOS

  • Business CooperationBusiness@metax-tech.com
  • Investor Relationsir@metax-tech.com