TLCR:基于Token级连续奖励的细粒度强化学习从人类反馈
计算与语言
2024-12-10 v2
摘要
强化学习从人类反馈(RLHF)利用人类偏好数据来训练语言模型,以更贴近人类本质。然而,这些人类偏好数据是在序列层面标记的,导致序列级偏好标签与标记之间存在不匹配——后者是从语言模型中自回归生成的。虽然已有若干方法试图为每个 individual token提供token级(即稠密)奖励,但这些方法通常依赖于预定义的离散奖励值(例如:正向:+1,负向:-1,中性:0),无法考虑每个token本身所蕴含的偏好程度差异。为此,我们引入TLCR(Token-Level Continuous Reward)用于RLHF,该方法采用训练以区分正负token的判别器,并利用判别器的置信度为每个token在上下文中分配连续奖励。大量实验表明,我们提出的TLCR在开放式生成基准测试中,相对于以前的序列级或token级离散奖励, consistently 实现性能提升。
引用
@article{arxiv.2407.16574,
title = {TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback},
author = {Eunseop Yoon and Hee Suk Yoon and SooHwan Eom and Gunsoo Han and Daniel Wontae Nam and Daejin Jo and Kyoung-Woon On and Mark A. Hasegawa-Johnson and Sungwoong Kim and Chang D. Yoo},
journal= {arXiv preprint arXiv:2407.16574},
year = {2024}
}
备注
ACL2024 Findings