简单则快,复杂则深:基于幂次长度惩罚的高效推理
计算与语言
2025-06-13 v1
摘要
大语言模型(LLMs)在推理能力上取得了显著进展,在各种具有挑战性的基准测试中表现良好。诸如思维链提示等技术被引入以进一步提升推理能力。然而,这些方法经常生成更长的输出,从而增加计算延迟。虽然一些方法使用强化学习来缩短推理,但它们通常施加均匀惩罚而不考虑问题的复杂性,导致次优结果。在本研究中,我们通过将奖励函数拆分并引入一种新颖的输出长度惩罚,旨在提升LLM推理的效率,在简单问题上促进简洁性,同时为更复杂的问题保留足够的推理以保证准确性,从而提升模型的整体性能。具体而言,我们通过划分奖励函数并加入一种新颖的长度惩罚来管理模型的推理效率。我们的方法在三个数据集的基准评估中取得了令人瞩目的成果:GSM8K、MATH500和AIME2024。对于相对更简单的数据集GSM8K和MATH500,我们的方法有效地缩短了输出长度,同时保持或提升了准确率。在更具挑战性的AIME2024数据集上,我们的方法带来了准确率的提升。
引用
@article{arxiv.2506.10446,
title = {Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty},
author = {Zehui Ling and Deshu Chen and Hongwei Zhang and Yifeng Jiao and Xin Guo and Yuan Cheng},
journal= {arXiv preprint arXiv:2506.10446},
year = {2025}
}