基于离线逆强化学习的查询依赖提示评估与优化
计算与语言
2024-03-08 v4 人工智能
机器学习
摘要
在本研究中,我们旨在通过零样本提示优化提升大语言模型(LLM)的算术推理能力。我们指出了此类优化中一个此前被忽视的查询依赖目标,并阐明了阻碍成功且经济地设计提示优化技术的两个随之而来的挑战。一个主要问题是在无法获取标准答案的推理过程中缺乏评估提示的有效方法。同时,通过与 LLM 交互来在广阔的自然语言提示空间中导航的学习被证明是资源密集型的。为此,我们引入了 Prompt-OIRL,其利用离线逆强化学习从离线提示示范数据中获取洞见。这类数据是在开放可访问数据集上基准测试多样提示时的副产品。借助 Prompt-OIRL,查询依赖提示优化目标通过首先学习一个离线奖励模型得以实现。该模型可在不访问 LLM 的情况下评估任意查询-提示对。随后,采用最佳-N 策略推荐最优提示。我们在不同 LLM 规模与算术推理数据集上的实验评估凸显了所提方法的效能与经济可行性。
引用
@article{arxiv.2309.06553,
title = {Query-Dependent Prompt Evaluation and Optimization with Offline Inverse RL},
author = {Hao Sun and Alihan Hüyük and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2309.06553},
year = {2024}
}