中文

面向可靠结构化LLM生成的交互式批判-修订训练

机器学习 2026-05-12 v1 人工智能

摘要

在结构化决策工作流程中,如表单填写、合规性检查和维护报告中,LLM输出必须在局部正确、全局一致,并针对特定任务规则进行可审计。现有精炼方法常依赖启发式辩论、自我博弈或LLM生成的监督,导致第二层保障问题。我们提出DPA-GRPO(Dual Paired-Action Group-Relative Policy Optimization),一种用于两人生成器-验证器博弈的配对动作训练方法,结构化验证器进行干预。生成器提出输出并在被挑战时可能进行修订;验证器要么保持沉默,要么提出包含主张、论证和证据的安全保障案(SAC)。这些SAC/无SAC和KEEP/REVISE决策诱导出配对的反事实行动组别,DPA-GRPO据此用于角色特定的KL正则化GRPO更新。我们分析未加正则化的博弈,证明严格低于奖励的干预或修订动作具有正概率会导致单方面偏好 deviations。基于标准随机近似假设,DPA-GRPO跟随相应的游戏ODE,其孤立的渐近稳定极限点是平稳点和候选局部均衡点,满足角色间局部最优性。在TaxCalcBench TY24上的实验表明,DPA-GRPO在Qwen3-4B和Qwen3-8B上优于零shot生成和仅生成器的RL基线,提高了结构化决策准确率。训练增加了正确的静默接受次数,减少了遗漏错误,改进了校准的修订行为,表明生成器和验证器均获益。

关键词

引用

@article{arxiv.2605.08327,
  title  = {Interactive Critique-Revision Training for Reliable Structured LLM Generation},
  author = {Fei Xu Yu and Zuyuan Zhang and Mahdi Imani and Nathaniel D. Bastian and Tian Lan},
  journal= {arXiv preprint arXiv:2605.08327},
  year   = {2026}
}