按需思考:自适应链律推理学习
计算与语言
2025-05-22 v2 人工智能
机器学习
摘要
链律推理(Chain of Thought, CoT)增强了语言模型的性能,但常导致简单问题上的“过度思考”。我们指出,现有方法直接惩罚推理长度,未能考虑问题复杂度的差异。我们的做法通过长度和质量比较构建奖励机制,基于理论假设联合提升解答正确性与简洁性。此外,我们进一步展示该方法可用于缺乏真实答案的模糊任务。跨多个推理基准的实验表明,我们的方法在保持准确率的同时,显著生成更简洁的解释,有效教会模型“按需思考”。
引用
@article{arxiv.2504.03234,
title = {Think When You Need: Self-Adaptive Chain-of-Thought Learning},
author = {Junjie Yang and Ke Lin and Xing Yu},
journal= {arXiv preprint arXiv:2504.03234},
year = {2025}
}
备注
Under review