SAT:面向无协调器的多 LLM 插件式训练的顺序代理调优
机器学习
2026-05-08 v1
摘要
拥有大量参数的大语言模型(LLM)取得了强大的性能,但部署成本常常高昂。近期研究探索使用由多个较小、更高效的 LLM 组成的团队,这些模型 collectively 匹配甚至超越单个大模型。然而,对多个代理进行联合更新会引入分布漂移的叠加效应,使训练过程中的协调和稳定性变得困难。我们通过引入顺序代理调优(Sequential Agent Tuning, SAT)来解决这一问题,这是一种无协调器的训练范式。SAT 将团队表示为分解策略,并对代理进行块坐标更新,实现可扩展的、去中心化的训练,无需中央控制器。具体而言,我们开发了一种序列感知、基于策略的优势估计器,其条件于演化中的团队策略,搭配每个代理的 KL 信任区域,以隔离占用率漂移。理论上,该框架提供了两项关键保证。首先,它确保单调改进,稳定训练过程。其次,它建立了可插即用不变性:任何代理都可以升级为更强的模型,而无需重新训练其余团队成员,性能界限 formally 保证会得到改善。实验方面,使用 SAT 训练的由三个 4B 参数代理组成的团队(共 12B 参数),在 AIME24/25 基准测试中平均超越了更大规模的 Qwen3-32B 模型 3.9%。我们通过替换为两个 8B 参数代理验证了插件式理论,composite score 提升 10.4%。我们提供代码及论文证明附录地址:https://github.com/Yydc/SAT-AAMAS
引用
@article{arxiv.2605.05216,
title = {SAT: Sequential Agent Tuning for Coordinator Free Plug and Play Multi-LLM Training with Monotonic Improvement Guarantees},
author = {Yi Xie and Yangyang Xu and Yi Fan and Bo Liu},
journal= {arXiv preprint arXiv:2605.05216},
year = {2026}
}
备注
Published at AAMAS 2026