中文

反长度位移:用于训练高效推理模型的动态异常截断

人工智能 2026-05-15 v2 计算与语言

摘要

增强强化学习并使用可验证奖励的大规模推理模型通过延长链式思维取得了显著性能提升。然而,这种范式在部署时会产生巨大的成本,因为模型经常在简单查询上表现得过于冗长。依赖显式长度惩罚的现有高效推理方法常常引入优化冲突,且对驱动过度思考的生成机制仍未得到充分考察。本文识别了一种称为长度位移的现象,即在训练期间模型会越来越多地生成不必要的推理。为此,我们引入动态异常截断 (DOT),这是一种针对训练时的干预方法,通过选择性抑制冗余标记。该方法仅针对完全正确 rollout 组中响应长度的极端尾部,同时保留针对复杂问题的长程推理能力。在此干预之外,我们进一步引入辅助KL正则化和预测动态抽样,以确保稳定收敛。实验结果表明,在多种模型规模上,我们的方法显著推动了效率-性能Pareto前沿向外扩展。值得注意的是,在AIME-24上,我们的方法将推理标记用量降低78%,同时在准确率方面显著提升,超过了最新的高效推理方法。

关键词

引用

@article{arxiv.2601.03969,
  title  = {Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models},
  author = {Wei Wu and Liyi Chen and Congxi Xiao and Tianfu Wang and Qimeng Wang and Chengqiang Lu and Yan Gao and Yi Wu and Yao Hu and Hui Xiong},
  journal= {arXiv preprint arXiv:2601.03969},
  year   = {2026}
}

备注

Accepted by ACL2026