中文

任重道远:探究RLHF中的长度相关性

计算与语言 2024-07-12 v2 机器学习

摘要

使用来自人类反馈的强化学习(RLHF)来对齐大语言模型已被报道取得巨大成功,开放偏好数据集使得更广泛的实验成为可能,特别是在对话和网络问答等任务的“有用性”方面。然而,伴随这些改进,RLHF也常常驱动模型产生更长的输出。本文在三种不同设置上证明,优化响应长度比先前认为的更是RLHF背后的重要因素。研究RL优化用于最大化奖励的策略,我们发现奖励的提升很大程度上由增加响应长度驱动,而非其他特征。事实上,我们发现即使是纯粹基于长度的奖励也能复现大多数针对监督微调模型的下游RLHF改进。测试了一组全面的对立长度干预措施,我们确定这些偏差的主要来源是奖励模型,通过研究训练动态,我们发现它们非鲁棒且容易受到偏好数据中长度偏差的影响。

关键词

引用

@article{arxiv.2310.03716,
  title  = {A Long Way to Go: Investigating Length Correlations in RLHF},
  author = {Prasann Singhal and Tanya Goyal and Jiacheng Xu and Greg Durrett},
  journal= {arXiv preprint arXiv:2310.03716},
  year   = {2024}
}

备注

21 pages, 13 figures, Accepted to COLM 2024