中文

PAG:基于策略即生成验证器的多轮强化LLM自纠错

计算与语言 2025-06-13 v1 人工智能 机器学习

摘要

大语言模型(LLMs)在复杂推理任务中展现了令人印象深刻的能力,但它们仍然难以可靠地验证自身输出的正确性。现有解决方案通常依赖于独立的验证器模型或需要多阶段自纠错训练流水线,这限制了可扩展性。在本文中,我们提出了PAG(Policy as Generative Verifier,策略即生成验证器),一个简单而有效的框架,通过在统一的多轮强化学习(RL)范式中交替扮演策略和验证器角色,赋予LLMs自纠错能力。与始终生成第二次尝试的先前方法不同,PAG引入了选择性修正机制:模型仅在其生成验证步骤检测到错误时才修正其回答。这种先验证后修正的工作流不仅缓解了模型崩溃,还联合增强了推理和验证能力。在多样化推理基准上的广泛实验突显了PAG的双重进步:作为策略,它增强了直接生成和自纠错准确性;作为验证器,其自验证表现优于自一致性。

关键词

引用

@article{arxiv.2506.10406,
  title  = {PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier},
  author = {Yuhua Jiang and Yuwen Xiong and Yufeng Yuan and Chao Xin and Wenyuan Xu and Yu Yue and Qianchuan Zhao and Lin Yan},
  journal= {arXiv preprint arXiv:2506.10406},
  year   = {2025}
}