基于数据影响导向树搜索的高效多智能体系统训练
计算与语言
2026-04-27 v2
摘要
基于蒙特卡洛树搜索(MCTS)的方法为生成合成数据以增强基于大语言模型(LLM)的多智能体系统(MAS)的自训练提供了有前景的途径。这些方法利用 Q 值来估计个体智能体的贡献。然而,仅依赖 Q 值来识别信息量丰富的数据可能与数据合成的目标不一致,因为重点应放在选择最能增强模型训练的数据上。为了解决这种差异,我们提出了数据影响导向树搜索(DITS),这是一个新颖的框架,它结合影响分数来指导树搜索和数据选择。通过利用影响分数,我们有效地识别出对系统改进最有影响力的数据,从而提升模型性能。此外,我们推导了针对不可微指标定制的影响分数估计方法,通过利用推理计算显著降低了计算开销。在八个多智能体数据集上的大量实验证明了所提方法的鲁棒性和有效性。值得注意的是,我们的发现表明,在数据合成过程中,分配更多的推理资源来估计影响分数,而不是 Q 值,可以更有效且高效地增强模型训练。
引用
@article{arxiv.2502.00955,
title = {Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search},
author = {Wentao Shi and Zichun Yu and Fuli Feng and Xiangnan He and Chenyan Xiong},
journal= {arXiv preprint arXiv:2502.00955},
year = {2026}
}
备注
Accepted by ACL 2026 Main;