中文

释放大语言模型作为提示优化器的潜力:与基于梯度的模型优化器的类比分析

计算与语言 2025-01-28 v3

摘要

自动提示优化是提升大语言模型(LLM)性能的重要途径。近期研究展示了将 LLM 用作提示优化器的潜力,其可通过迭代细化生成改进的任务提示。本文提出了一种研究基于 LLM 的提示优化器设计的新视角,即通过与基于梯度的模型优化器进行类比。为了连接这两种方法,我们确定了模型参数学习中的两个关键因素:更新方向和更新方法。通过对这两个方面的一系列改进策略进行系统分析,我们进一步开发了一种强大的受梯度启发的基于 LLM 的提示优化器,称为 GPO。在每一步中,它首先从优化轨迹中检索相关的提示作为更新方向。然后,它利用基于生成的细化策略执行更新,同时通过基于余弦的衰减策略控制编辑距离。大量实验证明了 GPO 的有效性和效率。特别是,与基线方法相比,GPO 在 Big-Bench Hard 上带来了高达 56.8% 的额外提升,在 MMLU 上带来了 62.6% 的提升。代码地址:https://github.com/RUCAIBox/GPO。

关键词

引用

@article{arxiv.2402.17564,
  title  = {Unleashing the Potential of Large Language Models as Prompt Optimizers: Analogical Analysis with Gradient-based Model Optimizers},
  author = {Xinyu Tang and Xiaolei Wang and Wayne Xin Zhao and Siyuan Lu and Yaliang Li and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2402.17564},
  year   = {2025}
}

备注

AAAI 2025