当前位置: 杭州网 - > - 杭网原创 - > - 原创新闻
扩散大模型为何“越灵活越吃亏”?阿里、清华最新研究给出答案
发布时间:2026-07-07 12:00:30 Tue  来源:杭州网杭州通客户端

当下一代大语言模型不断追求更自由的生成方式时,一项最新研究却提出了一个颇具颠覆性的观点:生成越灵活,推理能力反而可能越差。

7月5日,阿里巴巴与清华大学合作完成的论文《The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models(灵活性陷阱:重新审视扩散语言模型中任意顺序生成的价值)》入选国际机器学习大会(ICML 2026)杰出论文(Outstanding Paper)。杰出论文是ICML最高荣誉,通常每年仅授予2至3篇,获奖率约占接受论文的千分之一。

扩散大语言模型(dLLM)是当前备受关注的新一代语言模型架构,Google的Gemini Diffusion、中国人民大学的LLaDA等均属于这一技术路线。与GPT、Qwen等主流大语言模型必须按照从左到右顺序逐个生成token不同,dLLM可以任意选择生成顺序,理论上拥有更大的生成空间,因此近年来被寄予厚望。

不过,这项研究首次对这一核心优势提出质疑。论文指出,在数学、编程等通用推理任务中,任意顺序生成不仅没有提升模型能力,反而可能成为推理的“灵活性陷阱”。

研究团队发现,不确定性较高的关键逻辑节点,如“因此”“所以”等,就像推理过程中的分叉口。从左到右生成时,模型必须在此作出选择,完成推理后才能继续;而任意顺序生成时,模型往往会绕过这些难点,优先生成容易确定的内容。等到最后再补全这些关键节点时,上下文已经确定,原本需要推理的分叉口变成了“填空题”,推理路径也随之提前锁定。

研究者将这一现象命名为“熵退化”。

实验结果验证了这一发现。在HumanEval代码生成任务上,有21.3%的题目能够通过从左到右生成解决,却无法通过任意顺序生成完成;反过来的情况仅占0.6%。研究还发现,生成顺序的自由度越大,模型推理性能反而越差。

基于这一发现,团队提出了名为“JustGRPO”的训练方法,即在强化学习训练阶段放弃任意顺序生成,强制模型按照从左到右顺序生成,直接采用主流强化学习算法GRPO进行训练。

论文介绍,此前针对扩散语言模型设计强化学习算法,需要解决生成顺序不固定带来的归因等工程难题,因此催生了d1、ESPO、SPG、GDPO等多种复杂算法。而JustGRPO选择了一种更简洁的思路:训练阶段回归从左到右生成。

实验结果显示,采用JustGRPO训练后,模型推理速度不受影响,推理能力明显提升。在衡量大模型推理能力的GSM8K测试集上,模型准确率达到89.1%,全面超过d1、ESPO、SPG、GDPO等面向扩散模型设计的强化学习算法。

作者:记者 陈文婧  编辑:颉月娇
杭州网·杭州新闻门户网站