中文

双头不输于一:多主体协作推理的测试时扩展

人工智能 2025-08-20 v2

摘要

基于大型语言模型(LLM)构建的多主体系统(MAS)为解决单主体系统难以管理的复杂现实任务提供了可行路径。尽管最近的测试时扩展(TTS)技术显著提升了单主体在挑战性推理任务上的性能,但如何有效扩展MAS中的协作与推理仍是未开放之问。在本工作中,我们引入一种自适应多主体框架,通过模型层面的训练和系统层面的协调来增强协作推理。我们构建了M500数据集,包含500个多主体协作推理痕迹,并在该数据集上微调Qwen2.5-32B-Instruct以获得M1-32B,一个针对多主体协作优化的模型。为进一步实现自适应推理,我们提出了一种新型CEO主体,动态管理讨论过程,引导主体协作并调整推理深度以实现更有效的问题解决。在广泛的开源MAS中评估了该系统,包括常规理解、数学推理和编码等任务,显著优于强大基线。例如,M1-32B在GPQA-Diamond上提升12%,AIME2024上提升41%,MBPP-Sanitized上提升10%,在某些任务上匹配DeepSeek-R1等最先进模型的性能。这些结果凸显了学习型协作与自适应协调在扩展多主体推理中的重要性。代码已公开于https://github.com/jincan333/MAS-TTS。

关键词

引用

@article{arxiv.2504.09772,
  title  = {Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning},
  author = {Can Jin and Hongwu Peng and Qixin Zhang and Yujin Tang and Dimitris N. Metaxas and Tong Che},
  journal= {arXiv preprint arXiv:2504.09772},
  year   = {2025}
}