MASPOB:基于多臂老虎机的多代理系统提示优化
机器学习
2026-03-04 v1 人工智能
摘要
大型语言模型(LLM)在诸多实际应用中取得了巨大成功,尤其是作为多代理系统(MAS)的认知底层,协调实际场景中的复杂工作流程。由于许多部署场景禁止修改 MAS 工作流程且其性能高度依赖于输入提示,提示优化日益成为提升其性能的自然方法。然而,实际的 MAS 提示优化受到三个关键挑战的制约:(1)由于评估成本昂贵,需要样本高效性;(2)由拓扑结构引起的提示间耦合;(3)搜索空间的指数级爆炸。为此,我们引入 MASPOB(Multi-Agent System Prompt Optimization via Bandits),这是一种基于多臂老虎机的样本高效框架。通过利用上置置界(UCB)量化不确定性,老虎机框架在严格的预算限制下平衡探索与开发,最大化收益。为处理拓扑引起的耦合,MASPOB 将图神经网络(GNN)集成进来,以捕获结构先验,学习拓扑感知的提示语义表示。此外,它采用坐标升降法将优化分解为单变量子问题,使搜索复杂度从指数级降低到线性级。广泛的基准实验表明,MASPOB 实现了最先进的性能,始终优于现有基线。
引用
@article{arxiv.2603.02630,
title = {MASPOB: Bandit-Based Prompt Optimization for Multi-Agent Systems with Graph Neural Networks},
author = {Zhi Hong and Qian Zhang and Jiahang Sun and Zhiwei Shang and Mingze Kong and Xiangyi Wang and Yao Shu and Zhongxiang Dai},
journal= {arXiv preprint arXiv:2603.02630},
year = {2026}
}
备注
Preprint