中文

IAPO:面向高效推理的信息感知策略优化

计算与语言 2026-02-24 v1 机器学习

摘要

大型语言模型越来越依赖长链式思维以提高准确性,但这些收益伴随着巨大的推理时间成本。我们重新审视基于token效率的后训练方法,认为现有的序列级奖励塑形方法对推理资源在标记级别上的分配控制有限。为弥合这一差距,我们提出IAPO(Information-Aware Policy Optimization),一种基于每个标记与最终答案之间条件互信息(MI)的token级优势的后训练框架。这产生一种明确、原则性的机制,用于识别信息丰富的推理步骤并抑制低效益的探索。我们提供的理论分析表明,IAPO可在不损害正确性的前提下诱导推理 verbosity 的单调减少。实验上,IAPO在各种推理数据集上 consistently 改进推理准确性,同时将推理长度降低最高36%,超过现有的token-efficient RL方法。广泛的实证评估表明,信息感知的优势塑形是一种强大且通用的面向token-efficient后训练的方向。代码可在https://github.com/YinhanHe123/IAPO获取。

关键词

引用

@article{arxiv.2602.19049,
  title  = {IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning},
  author = {Yinhan He and Yaochen Zhu and Mingjia Shi and Wendy Zheng and Lin Su and Xiaoqing Wang and Qi Guo and Jundong Li},
  journal= {arXiv preprint arXiv:2602.19049},
  year   = {2026}
}