中文

重新思考代理奖励在语言模型对齐中的作用

机器学习 2024-10-08 v3 人工智能 计算与语言

摘要

通过代理奖励建模从人类反馈中学习已被研究用于将大型语言模型(LLMs)与人类价值观对齐。然而,通过该代理奖励模型(RM)实现可靠训练并非易事,其行为仍是一个黑箱。本文通过“逆向奖励工程”,将可解释特征组合为白盒奖励函数,研究代理奖励在 LLM 对齐中的作用。我们的目标是通过在使用代理奖励进行强化学习(RL)训练模型后,实现代理奖励信号与真实(黄金)奖励信号之间的单调关系,从而复现真实奖励信号。我们的发现表明,成功模拟黄金奖励需要生成与开放式问题足够相关且长度足够的回答,同时确保封闭式问题回答的一致性。此外,优化我们设计的白盒奖励所得到的模型在对齐基准测试中表现出与强大的开源 RM 相竞争的性能。我们强调其作为一种简单但强大的 LLM 对齐奖励基线的潜力,无需显式的人类反馈数据集和 RM 训练。我们的代码可在 https://github.com/naver-ai/rethinking-proxy-reward 获取。

关键词

引用

@article{arxiv.2402.03469,
  title  = {Rethinking the Role of Proxy Rewards in Language Model Alignment},
  author = {Sungdong Kim and Minjoon Seo},
  journal= {arXiv preprint arXiv:2402.03469},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 main conference