Shift-FFN:通过放大相邻 token 差异增强长链路思考推理
计算与语言
2025-05-26 v1 人工智能
摘要
最近,OpenAI-o1 和 DeepSeek-R1 等模型通过长链路思考(Long-CoT)推理在复杂推理任务上展现出卓越性能。尽管将此能力蒸馏到学生模型可显著提升性能,但本文发现,使用全参数或低秩 LoRA 在长 CoT 数据上微调 LLM 常导致循环推理,即模型重复之前的推理步骤直到达到最大长度限制。进一步分析表明,相邻 token 表示间差异较小与更易产生循环推理的倾向相关。为缓解此问题,本文提出 Shift 前馈网络(Shift-FFN),一种在将当前 token 表示与前一 token 表示编辑后输入 FFN 的新方法。该架构动态放大相邻 token 之间的表示差异。针对多个数学推理任务进行大量实验表明,LoRA 结合 Shift-FFN 在各种数据规模下实现更高准确率和更低的循环推理率,优于全参数微调和标准 LoRA。我们的数据和代码均已公开于 https://anonymous.4open.science/r/Shift-FFN。
引用
@article{arxiv.2505.17153,
title = {Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN},
author = {Yao Xu and Mingyu Xu and Fangyu Lei and Wangtao Sun and Xiangrong Zeng and Bingning Wang and Guang Liu and Shizhu He and Jun Zhao and Kang Liu},
journal= {arXiv preprint arXiv:2505.17153},
year = {2025}
}