中文

奖励丢弃改善控制:强化语言模型的双目标视角

机器学习 2023-11-27 v2 人工智能 计算与语言

摘要

我们从双目标优化视角研究强化语言模型(RLM)的理论方面。具体而言,我们将 RLM 视为一个同时最大化两个冲突目标(即奖励目标与似然目标)的帕累托优化问题。我们的主要贡献包含三部分。首先,我们通过提出奖励上界(RUBO)与帕累托最优性,建立了 RLM 作为帕累托优化问题的理论基础。我们的理论结果不仅由演绎证明支持,也由实证结果支持。其次,我们提出奖励丢弃(Reward Dropout),一种简单而强大的方法,可保证改善 RLM 的双目标优化。最后,我们证明奖励丢弃在五个基准数据集与四个基准 LLM 上始终有效,意味着奖励丢弃显著改善了 RLM 的优化性能。

关键词

引用

@article{arxiv.2310.04483,
  title  = {Reward Dropout Improves Control: Bi-objective Perspective on Reinforced LM},
  author = {Changhun Lee and Chiehyeon Lim},
  journal= {arXiv preprint arXiv:2310.04483},
  year   = {2023}
}

备注

29 pages, 13 figures, conference