何为不同于常规的推理模型?跟随推理领袖实现高效解码
计算与语言
2025-06-10 v1 人工智能
机器学习
摘要
大型推理模型(LRMs)通过发出长链式思考实现强大的推理性能,但这些冗长的痕迹会减慢推理速度,并常常偏离到不必要的细节,已知称为过度思考现象。为更好地理解 LRMs 的行为,我们系统性地分析了推理模型与非推理模型在标记级别上的错位。虽然可以预期,两者的主要区别在于风格化的"思考线索”,但 LRMs 独特地表现出两个尚未充分探讨的关键现象:一种是全局错位反弹,他们与非推理模型的差异在响应长度增加时持续或甚至扩大;更关键的是局部错位消弱,错位集中在每个句子开头的"思考线索"附近,但在句子其余部分迅速减弱。鼓励局部错位消弱,我们提出了 FoReaL-Decoding,即一种用于成本-质量权衡的协作式快速-慢速推理解码方法。在 FoReaL-Decoding 中,领袖模型领导每个句子的前几个标记,然后由较弱的草稿模型完成该句子其余标记。FoReaL-Decoding 采用随机门在小模型和大模型之间进行平滑插值。在四个流行的数学推理基准测试(AIME24、GPQA-Diamond、MATH500、AMC23)上,FoReaL-Decoding 可减少理论 FLOPs 降低 30%至 50%,并将思维链长度缩短最高可达 40%,同时保持 86%至 100% 的模型性能。这些结果将 FoReaL-Decoding 确立为可控成本-质量权衡在推理中心任务中的简单、即插即用的路径。
引用
@article{arxiv.2506.06998,
title = {What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding},
author = {Ming Li and Zhengyuan Yang and Xiyao Wang and Dianqi Li and Kevin Lin and Tianyi Zhou and Lijuan Wang},
journal= {arXiv preprint arXiv:2506.06998},
year = {2025}
}