News
时间:2026-09-29
9月28日,上海人工智能实验室宣布,开源旗下决策模型“书生·明决(Intern-Decision)”。与新晋爆火的Jev决策模型相比,该模型包含0.8B、2B、4B三档参数版本,性能超越前者及同类开源模型。凭借自研高性能通用 GPU 与 MXMACA 软件栈一体化协同的产品优势,沐曦股份率先完成对“书生·明决”模型的 Day 0 适配,实现上线即适配。
自2025年12月以来,沐曦股份已完成40个主流旗舰模型的Day 0适配。范围涵盖智谱、阿里千问、MiniMax、DeepSeek、阶跃星辰、腾讯混元等头部模型厂商,适配速度、数量、生态广度均位居行业前列。
与传统的大语言模型相比,决策模型放弃了文本生成能力,专注于快速输出结构化的判断结果。Jev 的口号是 “Decisions, not strings”(要决策,不要文本),模型通过三项核心能力,即Choice(从预设的选项里挑出最合适的一项,并给出每个选项的概率)、Score(在自定义尺度上打分)、Noul(回答是/否并给出概率),直接输出一个选择、一个评分,或一个概率值作为“判断”。
“书生·明决”模型在此基础上,进一步构建多模态决策能力,把视觉信息融入决策环节,实现决策选择和画面感知相结合,“在“看见”画面的同时做出精准决断。
团队通过游戏、图形界面等操作演示,验证了“书生·明决”的多模态决策能力。在真实游戏场景里,“书生·明决”能直接读取游戏画面,自主选择下一步动作。测试用到的游戏画面类型丰富,包括二维网格地图、横版闯关场景,以及第一人称三维场景,需要模型完成路线选择、识别危险物品、判断空间方位等任务。团队观察到,在部分场景下,AI角色撞到墙壁后,会主动转动视角,寻找新目标。
在图案验证码演示中,“书生·明决”模型可以独立完成读懂指令、识别图案目标、输出点击动作整套操作。全换成自主完成,无需人工介入修正,直观展现了它结合视觉识别、自主选择操作的交互能力。
模型性能基准测试结果显示,围绕JevBench的Easy(简单)、Original(标准)、Hard(困难)三个测试子集,以及Typed Decision(类型化决策)、ToolACE(工具调用)、AG News(新闻主题分类)和WildJailBreak(网络对抗安全判定)共七项任务开展对比评测。“书生·明决”4B模型的平均得分为90.02,较Jev的88.74高出1.28分,在本次参评模型中居首位。
在验证模型稳定性的可靠性测试中,研究团队发现,在JevBench-Hard的可靠性分析中,校准前模型在高置信度区域存在偏差,部分接近0.9或1.0的置信度并未对应同等水平的准确率。校准后,这一偏差有所减小,为后续根据置信度进行任务分流提供了依据。对比Jev的置信度表现,“书生·明决”模型的校准效果更优。
JevBench-Hard上的可靠性曲线 对角线表示置信度与准确率一致
模型团队还构建了选项概率分布评测集,覆盖直接随机性、混合分布、条件概率、观测偏差、概率谜题和序列过程六类场景,并为每道题提供精确的参考分布。测试显示,经过校准优化后,“书生·明决”的概率预测误差明显下降,关键指标均优于Jev。
此次成功完成模型的Day 0适配,也充分验证了沐曦股份软硬件一体化协同的优势。
作为 “自主 GPGPU 硬件 + 全栈软件体系” 的核心枢纽,沐曦自研 MXMACA 软件栈承担着连接底层算力硬件与上层 AI 应用生态的关键纽带作用。它不仅全链路覆盖底层驱动、用户态接口、MXCC 编译器、算子深度适配、主流训练/推理框架对接及行业场景专项优化。目前,MXMACA 软件栈已实现对主流 AI 生态的广泛覆盖:兼容支持40余种 AI 框架、1000 多款模型,适配超 6000 个开源项目测试,全量支持 PyTorch 2.8的 2410 个GPU算子。
未来,沐曦股份将长期致力推动国产算力从“可用”走向“好用”“易用”,持续深化与国内顶尖AI团队的技术协同,构建自主可控、创新繁荣的国产 AI 生态。
“书生·明决”模型开源链接
GitHub:https://github.com/InternLM/Intern-Decision
Hugging Face:https://huggingface.co/collections/internlm/intern-decision