中文

T-REG:基于词级奖励正则化的偏好优化

计算与语言 2024-12-04 v1 人工智能 机器学习

摘要

从人类反馈中进行强化学习(RLHF)是将大型语言模型(LLM)与人类价值观对齐的关键方法。传统方法是为查询生成响应,并使用奖励模型为整个响应分配奖励,但这种方法面临对单个稀疏奖励的依赖,使得模型难以识别序列中哪些部分对最终奖励贡献最大。近期方法尝试通过引入词级奖励来缓解这一限制,但这些方法常依赖训练好的信用分配模型或AI注释员,引发对奖励质量和可靠性的担忧。本文提出了词级奖励正则化(T-REG),一种新颖的方法,利用序列级和词级奖励进行偏好优化。通过利用LLM的自我完善能力,我们的 метод使用对比式提示使LLM自行生成词级奖励。这些自生成的奖励作为奖励正则化,引导模型更有效地在词级分布序列级奖励。这有助于更好的词级信用分配并提高对齐性能。在包括Alpaca Eval 2和Arena-Hard在内的指令遵循基准测试中,我们的方法分别比基线方法提高了最高可达3.8%和4.4%。我们将在https://github.com/wzhouad/T-REG发布代码和模型。

关键词

引用

@article{arxiv.2412.02685,
  title  = {T-REG: Preference Optimization with Token-Level Reward Regularization},
  author = {Wenxuan Zhou and Shujian Zhang and Lingxiao Zhao and Tao Meng},
  journal= {arXiv preprint arXiv:2412.02685},
  year   = {2024}
}