简单的“再尝试”可引发多轮大语言模型推理
机器学习
2025-08-25 v2 人工智能
摘要
多轮问题解决是大规模推理模型(LRMs)面临的关键挑战,尤其在反思推理并根据反馈进行修正方面。现有的强化学习(RL)方法在单轮范式上训练大规模推理模型,仅使用可验证的奖励。然而,我们注意到使用现有RL范式训练的模型常常丧失跨多轮解决问题的能力,难以根据情境反馈进行修正,导致重复响应。我们提出:LRMs能否在多轮情境中反思并修正答案?本文发现,使用仅来自错误答案后单一反馈(如“让我们再试试”)的多轮RL训练,能够提升单轮表现和多轮推理能力。我们提出“单一反馈作为观察”(Unary Feedback as Observation, UFO)用于强化学习,该方法在迭代问题解决期间使用最小且常见的单一用户反馈。它可轻松应用于现有的单轮RL训练设置。实验结果表明,采用UFO进行的RL训练保持单轮表现,同时将多轮推理准确率提升最高可达14%,使语言模型在多轮问题解决中更好地应对反馈。为进一步减少正确答案所需的轮数,同时鼓励在出错时进行多样化推理,我们设计了引导模型在每一轮中进行仔细和深思的奖励结构。代码:https://github.com/lichengliu03/unary-feedback
引用
@article{arxiv.2507.14295,
title = {A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning},
author = {Licheng Liu and Zihan Wang and Linjie Li and Chenwei Xu and Yiping Lu and Han Liu and Avirup Sil and Manling Li},
journal= {arXiv preprint arXiv:2507.14295},
year = {2025}
}