等等,等等,等等……推理模型为何会循环?
机器学习
2025-12-16 v1
摘要
推理模型(如 DeepSeek-R1)生成冗长的思维链以解决更难的问题,但它们经常循环,在低温或贪婪解码下重复相同的文本。我们研究了此现象发生的原因及温度所扮演的角色。对于开源推理模型,我们发现循环在低温下很常见。较大的模型倾向于较少循环,而蒸馏的学生模型即使在其教师模型极少循环的情况下也会显著循环。这指向训练分布与所学模型之间的不匹配——我们称之为学习误差——将其作为关键原因。为理解此类误差如何导致循环,我们引入了一个合成图推理任务并展示了两种机制。首先,由学习困难引起的风险规避:当做出正确进展的动作难以学习但存在一个简单的循环动作时,模型会将相对更多的概率分配给循环动作并陷入停滞。其次,即使不存在学习困难,Transformer 也表现出对时间相关误差的归纳偏置,因此同样的少数动作不断被选中从而出现循环。较高温度通过促进探索来减少循环,但它并不能修复学习误差,因此在高温下生成内容仍远超必要长度;就此而言,温度只是一种权宜之计而非根本解决方案。最后,我们讨论了旨在直接减少学习误差的训练时干预措施。
引用
@article{arxiv.2512.12895,
title = {Wait, Wait, Wait... Why Do Reasoning Models Loop?},
author = {Charilaos Pipis and Shivam Garg and Vasilis Kontonis and Vaishnavi Shrivastava and Akshay Krishnamurthy and Dimitris Papailiopoulos},
journal= {arXiv preprint arXiv:2512.12895},
year = {2025}
}