RLTHF:面向 LLM 对齐的针对性人类反馈
计算与语言
2025-08-08 v3 人工智能
机器学习
摘要
由于基于人类反馈的强化学习(RLHF)中高质量人类标注成本高昂,且 AI 反馈存在泛化性局限,微调大型语言模型(LLM)以使其与用户偏好对齐颇具挑战。为应对这些挑战,我们提出了 RLTHF,这是一种人机混合框架,将基于 LLM 的初始对齐与选择性人类标注相结合,以最小的人力实现与全人类标注同等的对齐效果。RLTHF 利用奖励模型的奖励分布识别被 LLM 误标的困难标注样本,并通过整合策略性的人类纠正,同时利用 LLM 正确标注的样本,迭代地增强对齐效果。在 HH-RLHF 和 TL;DR 数据集上的评估表明,RLTHF 仅需 6-7% 的人类标注工作量即可达到全人类标注水平的对齐。此外,在 RLTHF 策划的数据集上训练的模型在下游任务中优于在全人类标注数据集上训练的模型,凸显了 RLTHF 的有效性。
引用
@article{arxiv.2502.13417,
title = {RLTHF: Targeted Human Feedback for LLM Alignment},
author = {Yifei Xu and Tusher Chakraborty and Emre Kıcıman and Bibek Aryal and Eduardo Rodrigues and Srinagesh Sharma and Roberto Estevao and Maria Angels de Luis Balaguer and Jessica Wolk and Rafael Padilha and Leonardo Nunes and Shobana Balakrishnan and Songwu Lu and Ranveer Chandra},
journal= {arXiv preprint arXiv:2502.13417},
year = {2025}
}
备注
Presented at ICML 2025