聪明而非蛮力:基于推理感知优化的自适应推理
人工智能
2025-02-03 v2
摘要
解决数学问题是大型语言模型的引人入胜的能力,已通过延长推理长度(如自我纠正和广泛的长链思维)来改进推理的诸多努力。虽然在问题解决方面取得了令人期待的进展,但高级的长推理链模型表现出一种不寻常的单一模行为,即微不足道的问题需要不必要冗长的思考链。本文提出一种方法,使模型能够意识到推理预算,通过将其形式化为对推理预算约束的效用最大化来实现,从而命名我们的算法为推理预算受限策略优化(Inference Budget-Constrained Policy Optimization, IBPO)。简而言之,通过IBPO微调的模型学习“理解”查询的难度并为更难的查询分配推理预算。根据不同的推理预算,我们的最佳模型在使用2.16倍和4.32倍推理预算的情况下,分别比LLaMA3.1 8B Instruct在MATH500上实现了4.14%和5.74%的绝对改进(分别为8.08%和11.2%的相对改进)。这些改进约为自洽性在相同预算下的2倍。
引用
@article{arxiv.2501.17974,
title = {Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization},
author = {Zishun Yu and Tengyu Xu and Di Jin and Karthik Abinav Sankararaman and Yun He and Wenxuan Zhou and Zhouhao Zeng and Eryk Helenowski and Chen Zhu and Sinong Wang and Hao Ma and Han Fang},
journal= {arXiv preprint arXiv:2501.17974},
year = {2025}
}