中文

按需思考:自适应链律推理学习

计算与语言 2025-05-22 v2 人工智能 机器学习

摘要

链律推理(Chain of Thought, CoT)增强了语言模型的性能,但常导致简单问题上的“过度思考”。我们指出,现有方法直接惩罚推理长度,未能考虑问题复杂度的差异。我们的做法通过长度和质量比较构建奖励机制,基于理论假设联合提升解答正确性与简洁性。此外,我们进一步展示该方法可用于缺乏真实答案的模糊任务。跨多个推理基准的实验表明,我们的方法在保持准确率的同时,显著生成更简洁的解释,有效教会模型“按需思考”。

关键词

引用

@article{arxiv.2504.03234,
  title  = {Think When You Need: Self-Adaptive Chain-of-Thought Learning},
  author = {Junjie Yang and Ke Lin and Xing Yu},
  journal= {arXiv preprint arXiv:2504.03234},
  year   = {2025}
}

备注

Under review