ThinkEdit:可解释权重编辑以缓解推理模型中的过度简短思考
计算与语言
2025-10-01 v4 机器学习
摘要
最近的研究表明,增强链律思 (CoT) 的大型语言模型 (LLM) 在问题解决方面展现出惊人的能力。然而,本工作识别到这些模型偶尔生成过于简短的推理,导致即使是简单的数学问题性能下降。具体而言,我们调查推理长度在推理模型隐藏表示中的嵌入方式及其对准确性的影响。我们的分析揭示,推理长度由表示空间中的一个线性方向控制,这使我们能够通过沿该方向引导模型来诱导过度简短的推理。基于这一洞察,我们提出了 ThinkEdit,一种简单而有效的权重编辑方法,以缓解过度简短推理的问题。我们首先识别出约 4% 的注意力头主要驱动短推理行为,然后编辑这些头的输出投影权重以消除短推理方向。通过仅修改 0.2% 的模型参数,ThinkEdit 有效减少了过度简短的推理,显著提升了短推理输出的准确率(+6.39%),并在多个数学基准测试中实现整体改进(+3.34%)。我们的发现提供了关于如何在 LLM 中控制推理长度的新的机制性见解,并凸显了通过细粒度模型干预来提高推理质量的潜力。我们的代码可在 https://github.com/Trustworthy-ML-Lab/ThinkEdit 获取。
引用
@article{arxiv.2503.22048,
title = {ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models},
author = {Chung-En Sun and Ge Yan and Tsui-Wei Weng},
journal= {arXiv preprint arXiv:2503.22048},
year = {2025}
}
备注
Accepted to EMNLP 2025