FedPOB:基于赌博机的高效样本联邦提示优化
机器学习
2025-09-30 v1 人工智能
摘要
大型语言模型(LLM)的性能对输入提示高度敏感,这使得提示优化成为一项关键任务。然而,现实世界的应用受到三大主要挑战的阻碍:(1) 强大的专有 LLM 的黑盒性质,(2) 由于查询成本而对高样本效率的需求,以及 (3) 多用户之间隐私保护的协作需求。为了同时应对这些挑战,我们引入了一种基于多臂赌博机(MAB)的高效样本联邦提示优化新框架。MAB 框架特别适合这一问题,因为它是 (1) 天然的黑盒优化方法,(2) 实际上具有高样本效率,并且 (3) 能够实现具有理论保证的协作学习,且能从更多参与智能体中获益。我们首先提出了基于赌博机的联邦提示优化(FedPOB)算法,这是 Linear UCB 算法的联邦变体,其中智能体通过共享模型参数而非原始数据进行协作。然后,我们将该方法扩展到比较性用户反馈的实际设置中,引入了带偏好反馈的 FedPOB(FedPOB-Pref),这是一种基于联邦对决赌博机的高效算法。大量实验表明,FedPOB 和 FedPOB-Pref 均显著优于现有基线,并且随着更多智能体参与协作,其性能持续提升,验证了我们联邦方法的有效性。
引用
@article{arxiv.2509.24701,
title = {FedPOB: Sample-Efficient Federated Prompt Optimization via Bandits},
author = {Pingchen Lu and Zhi Hong and Zhiwei Shang and Zhiyong Wang and Yikun Ban and Yao Shu and Min Zhang and Shuang Qiu and Zhongxiang Dai},
journal= {arXiv preprint arXiv:2509.24701},
year = {2025}
}
备注
Preprint