中文

CTTS:集合化测试时扩展

计算与语言 2025-09-30 v2 人工智能

摘要

测试时扩展 (Test-time scaling, TTS) 已成为一种引人注目的、无需训练即可提升大型语言模型 (LLM) 性能的方法。然而,现有方法如 Best-of-N 和 Self-Consistency 的有效性在根本上受到单一测试时扩展 (STTS) 范式的限制,该范式依赖单个 LLM 代理与单个奖励模型 (SA-SR) 交互。鼓励最近研究表明集合方法可超越单个模型的性能上限,我们引入了集合化测试时扩展 (Collective Test-Time Scaling, CTTS)。首先,我们系统性地研究了现有多个模型的三种主要交互范式:单代理-多奖励 (SA-MR)、多代理-单奖励 (MA-SR) 和多代理-多奖励 (MA-MR)。大量实验表明,MA-MR 范式始终优于其他范式。基于这一发现,我们进一步提出了 CTTS-MM 框架,该框架实现了多代理和多奖励的协作。CTTS-MM 集成了两个关键技术贡献:(1) 对于代理协作,采用 Agent Collaboration Search (ACS) 从候选池中识别最有效的 LLM 组合;(2) 对于奖励模型协作,采用 Mixture of Reward Models (MoR) 策略,利用 Prior Reward model Ensemble Selection (PRES) 算法选择最佳集成。跨越七大主流基准的评估表明,CTTS-MM 在最先进的 STTS 方法上显著超越 (+4.82% 超过 Best-of-N),并超过甚至是旗舰专有 LLM (+7.06% 超过 GPT-4.1) 和开源 LLM。这些结果凸显了集合化扩展在推动 LLM 推理前沿方面的巨大潜力。代码将在 https://github.com/magent4aci/CTTS-MM 上发布。

关键词

引用

@article{arxiv.2508.03333,
  title  = {CTTS: Collective Test-Time Scaling},
  author = {Zhende Song and Shengji Tang and Peng Ye and Jiayuan Fan and Lei Bai and Tao Chen and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2508.03333},
  year   = {2025}
}