TRACER:基于内型强化信用信号的轮次级后悔匹配式合作多 LLM 推理
摘要
大型语言模型日益依赖强化学习或多智能体提示来提高推理能力,但这两种范式在实际应用中仍难以有效结合。直接将单智能体强化学习应用于多轮多智能体系统面临以下困境:i) 奖励稀疏、角色层次性违约以及训练开销过大。ii) 智能体仅通过模仿来协作。iii) 固定的协作协议会陷入振荡性局部最优。我们提出 TRACER,这是一个用于合作多 LLM 推理的轮次级强化框架。TRACER 将协作决策分离为控制器-后悔层和生成-信用层,其中控制器通过后悔匹配学习智能体是否应在当前轮次发言或跳过,而生成-信用层则通过角色特定的 GSPO 奖励优化提议人和审阅者的语言输出。该设计 i) 在动作模式和生成语言输出两个层面上分配信用,从而避免违约和稀疏奖励。我们仅扩展控制器所做出的选择,从而大幅降低训练的计算成本。此外,ii) 智能体在学习何时发言以及说些什么时获得协作能力。最后,iii) 通过巧妙地设计二元动作,我们将经典游戏理论在有限动作空间上建立的模型扩展到深度学习中,从而实现数学上的严格收敛。我们在 GSM8K 训练集上训练所有本地 RL-style 方法,并在保留下来的 GSM8K、MATH500 和 GPQA-Diamond 上进行评估,以衡量领域内准确率、跨基准泛化、推理成本和纠错保持行为。 resulting framework provides a compact and reproducible testbed for studying learned collaboration policies beyond fixed debate, voting, or aggregation protocols. Code is available at https://github.com/Shark-Forest/TRACER.
引用
@article{arxiv.2605.28699,
title = {TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning},
author = {Chusen Li and Zhou Liu and Shuigeng Zhou and Wentao Zhang},
journal= {arXiv preprint arXiv:2605.28699},
year = {2026}
}
备注
25 pages, 3 figures