中文

没有免费午餐:重新思考 LLM 推理中的内部反馈

机器学习 2025-06-26 v2 人工智能

摘要

强化学习已成为后训练大型语言模型(LLMs)以提高推理能力的强大范式。像强化学习从人类反馈(RLHF)和强化学习与可验证奖励(RLVR)等方法已显示出强大的结果,但它们需要大量的外部监督。我们研究另一类方法,即强化学习从内部反馈(RLIF),该方法仅依赖于来自模型本身的内在信号,而非外部奖励。特别是,我们利用无监督奖励代理,如标记级熵、轨迹级熵和自信度。我们的理论分析显示这些内部目标是部分等价的,我们在具有挑战性的数学推理基准测试上对 various RLIF 策略进行经验评估。实验结果表明,RLIF 在训练初期可提升基座 LLM 的推理性能,在这些任务上匹配或超越 RLVR 技术。然而,随着训练的进行,性能会下降甚至低于训练前的模型。此外,我们发现 RLIF 对 instruction-tuned 模型几乎没有改进,表明一旦 LLM 已进行 instruction 调优,内在反馈的效用就会降低。我们进一步通过混合模型权重分析了这一局限性,解释了 RLIF 训练行为的原因,为将内部反馈信号集成到 LLM 训练中提供了实用指南。我们希望我们的对内部反馈的分析将为 LLM 后训练制定更多原则且有效的策略提供指导。

关键词

引用

@article{arxiv.2506.17219,
  title  = {No Free Lunch: Rethinking Internal Feedback for LLM Reasoning},
  author = {Yanzhi Zhang and Zhaoxi Zhang and Haoxiang Guan and Yilin Cheng and Yitong Duan and Chen Wang and Yue Wang and Shuxin Zheng and Jiyan He},
  journal= {arXiv preprint arXiv:2506.17219},
  year   = {2025}
}