奖励丢弃改善控制:强化语言模型的双目标视角
机器学习
2023-11-27 v2 人工智能
计算与语言
摘要
我们从双目标优化视角研究强化语言模型(RLM)的理论方面。具体而言,我们将 RLM 视为一个同时最大化两个冲突目标(即奖励目标与似然目标)的帕累托优化问题。我们的主要贡献包含三部分。首先,我们通过提出奖励上界(RUBO)与帕累托最优性,建立了 RLM 作为帕累托优化问题的理论基础。我们的理论结果不仅由演绎证明支持,也由实证结果支持。其次,我们提出奖励丢弃(Reward Dropout),一种简单而强大的方法,可保证改善 RLM 的双目标优化。最后,我们证明奖励丢弃在五个基准数据集与四个基准 LLM 上始终有效,意味着奖励丢弃显著改善了 RLM 的优化性能。
引用
@article{arxiv.2310.04483,
title = {Reward Dropout Improves Control: Bi-objective Perspective on Reinforced LM},
author = {Changhun Lee and Chiehyeon Lim},
journal= {arXiv preprint arXiv:2310.04483},
year = {2023}
}
备注
29 pages, 13 figures, conference