自适应合作竞争:利用粗糙验证器信号实现多代理 LLM 推理的韧性
多智能体系统
2025-10-23 v2
摘要
推理时间计算是增强大型语言模型(LLM)推理性能的关键且具有挑战性的范式。虽然现有策略改善了推理稳定性和一致性,但存在显著局限:自我纠正往往强化模型初始偏见,多代理合作(MAC)因缺乏有效的协调机制而常常失败,导致集体错误。尽管高性能验证器能够检测推理错误,但需要大量训练才能成为可靠的工具。为此,我们引入一种新型推理时间框架——自适应合作竞争(Adaptive Coopetition, AdCo),其中 LLM 代理利用基于 UCB 的自适应“合作竞争”机制。在每个轮次中,代理人利用粗糙验证器信号决定是合作还是竞争,并根据同行反馈迭代细化其推理。无需依赖高性能验证器,我们的自适应策略在数学推理基准测试中实现了显著的性能提升,在更具挑战性的数据集上相对于基线实现了约20%的相对改进。我们的 метод在不同样本大小和配置下保持稳健且一致的准确率。该自适应、信号导向的“合作竞争”框架通过利用模型知识的多样性和推理轨迹度量,提升了推理韧性,同时促进了不确定性驱动的探索,尤其当参与者能力相当时。从这个角度看,我们的工作为推理时间计算提供了新的视角,为构建更具韧性的多代理 LLM 系统指明了方向。我们的代码可在 https://github.com/AdCo-Research/adaptive-coopetition 查阅。
引用
@article{arxiv.2510.18179,
title = {Adaptive Coopetition: Leveraging Coarse Verifier Signals for Resilient Multi-Agent LLM Reasoning},
author = {Rui Jerry Huang and Wendy Liu and Anastasia Miin and Lei Ding},
journal= {arXiv preprint arXiv:2510.18179},
year = {2025}
}
备注
13 pages, 8 figures. Accepted for presentation at the 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025