MORL-Prompt:离散提示优化中多目标强化学习的实证分析
计算与语言
2025-06-10 v2
摘要
基于强化学习(RL)的技术可用于搜索提示,当这些提示输入目标语言模型时,能最大化一组用户指定的奖励函数。然而,在许多目标应用中,自然奖励函数之间存在张力——例如风格迁移任务中的内容保留与风格匹配。当前技术侧重于最大化奖励函数的平均值,这不一定能实现跨奖励平衡的提示——这一问题在多目标和鲁棒优化文献中已得到充分研究。在本文中,我们对几种适应于这一新设置(即基于 RL 的离散提示优化)的现有多目标优化技术进行了实证比较。我们比较了两种优化 Pareto 奖励曲面体积的方法和一种选择能同时惠及所有奖励的更新方向的方法。我们在两个自然语言处理任务(风格迁移和机器翻译)上评估了性能,每个任务使用三个相互竞争的奖励函数。我们的实验表明,直接优化 Pareto 奖励曲面体积的多目标方法比试图寻找单调更新方向的方法表现更好,并能实现所有奖励的更好平衡。
引用
@article{arxiv.2402.11711,
title = {MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimization},
author = {Yasaman Jafari and Dheeraj Mekala and Rose Yu and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:2402.11711},
year = {2025}
}