基于人类反馈的提示优化
机器学习
2024-05-28 v1 人工智能
摘要
大语言模型 (LLM) 在各种任务中展现出了卓越的性能。然而,LLM 的性能在很大程度上取决于输入提示,这催生了近期关于提示优化的许多工作。但是,先前的工作通常需要可用的数值分数来评估每个提示的质量。不幸的是,当人类用户与黑盒 LLM 交互时,获得这样的分数通常是不可行且不可靠的。相反,从人类用户那里获得偏好反馈通常要容易和可靠得多,即向用户展示由一对提示生成的回复,并询问用户偏好哪一个。因此,在本文中,我们研究基于人类反馈的提示优化 (POHF) 问题,旨在仅使用人类偏好反馈来优化黑盒 LLM 的提示。受决斗强盗的启发,我们设计了一种理论上有原则的策略,在每次迭代中选择一对提示来查询偏好反馈,从而引入了名为自动化 POHF (APOHF) 的算法。我们将 APOHF 算法应用于各种任务,包括优化用户指令、文本到图像生成模型的提示优化,以及基于人类反馈的回复优化(即使用 APOHF 的变体进一步优化回复)。结果表明,我们的 APOHF 能够使用少量偏好反馈实例高效地找到好的提示。我们的代码可在 \url{https://github.com/xqlin98/APOHF} 找到。
引用
@article{arxiv.2405.17346,
title = {Prompt Optimization with Human Feedback},
author = {Xiaoqiang Lin and Zhongxiang Dai and Arun Verma and See-Kiong Ng and Patrick Jaillet and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2405.17346},
year = {2024}
}
备注
Preprint, 18 pages