中文

In-Token 理性优化:通过自我反馈实现 LLM 推理的准确性和简洁性

计算与语言 2025-11-14 v1

摘要

为大型语言模型(LLM)进行链式思维推理进行监督微调是一个重大的挑战:对单个“黄金”理由进行监督微调会损害泛化能力,因为它对等效备选方案的惩罚相同,而使用可验证奖励的强化学习在信用分配方面困难且计算成本高昂。为克服这些限制,我们引入了 InTRO (In-Token Rationality Optimization),一种新的框架,旨在通过自我反馈实现准确且简洁的推理。该方法不直接对所有有效推理路径上难以处理的目标进行优化,而是利用 correction factors——由生成策略与其答案条件化后的策略之间的信息偏差估计的 token 级重要性权重——用于信息丰富的下一个 token 选择。这种方法允许模型在单个前向传递中进行 token 级探索并接收自生成的反馈,最终鼓励准确且简洁的理由。跨六个数学推理基准测试,InTRO 始终优于其他基线方法,将解决方案准确率提高最高可达 20%。其链式思维也显著更为简洁,表现出更少的冗长。除此之外,InTRO 还能实现跨域迁移,成功适应超越数学领域的推理任务,表现出稳健的泛化能力。

关键词

引用

@article{arxiv.2511.09865,
  title  = {In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback},
  author = {Mingye Zhu and Yi Liu and Zheren Fu and Quan Wang and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2511.09865},
  year   = {2025}
}

备注

AAAI 2026 Oral