RLHF中的准确性悖论:当更好的奖励模型不导致更好的语言模型时
计算与语言
2024-10-17 v2 人工智能
摘要
强化学习从人类反馈(RLHF)显著提升了自然语言处理领域的语言模型,使其更符合人类期望。在这一对齐过程中,奖励模型的强度是一个关键因素。本研究探讨了更强的奖励模型是否必然导致更好的语言模型。本文通过在相关性、事实性和完整性任务上使用QA-FEEDBACK数据集和基于Longformer的奖励模型进行实验,发现了一个惊人的悖论:使用中等准确度的奖励模型训练的语言模型优于由高度准确的奖励模型所指导的模型。这挑战了更强的奖励模型总能导致更好语言模型的普遍信念,为未来研究探索模型性能驱动因素及如何选择最合适奖励模型的关键因素开辟了新方向。代码和附加细节可在 https://github.com/EIT-NLP/AccuracyParadox-RLHF 中获得。
关键词
引用
@article{arxiv.2410.06554,
title = {The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models},
author = {Yanjun Chen and Dawei Zhu and Yirong Sun and Xinghao Chen and Wei Zhang and Xiaoyu Shen},
journal= {arXiv preprint arXiv:2410.06554},
year = {2024}
}
备注
10 pages, 27 figures (including 18 in the appendix), submitted to EMNLP 2024