中文

基于纯探索老虎机的高效多目标提示优化

机器学习 2026-05-15 v1 人工智能

摘要

提示工程已成为激发大型语言模型(LLM)能力的核心。其核心在于提示选择——高效地识别最有效的提示。然而,大多数先前的研究忽略了一个关键挑战:提示性能本质上具有多面性,无法通过单一指标来捕捉。为了填补这一空白,我们在两种实际设置下研究了多目标提示选择问题:Pareto 提示集恢复和最佳可行提示识别。将该问题转化为纯探索老虎机框架,我们改编了来自多目标老虎机的可证明高效算法,并进一步引入了一种用于结构化老虎机中最佳可行臂识别的新颖设计,在线性情况下提供了识别误差的理论保证。在多个 LLM 上的大量实验表明,基于老虎机的方法比基线取得了显著改进,为多目标提示优化建立了一个有原则且高效的框架。

关键词

引用

@article{arxiv.2605.14553,
  title  = {Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits},
  author = {Donghao Li and Chengshuai Shi and Weijuan Ou and Cong Shen and Jing Yang},
  journal= {arXiv preprint arXiv:2605.14553},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026