SCAR:基于Shapley 信用分配的更高效 RLHF 方法
人工智能
2025-05-28 v1
摘要
从人类反馈中进行强化学习 (RLHF) 是对大型语言模型 (LLM) 与人类偏好一致性调校的常用技术,但常因稀疏奖励信号导致信用分配困难。在典型设置下,奖励模型为整个生成序列提供单个标量得分,无法揭示哪些 token 或片段级决策导致了该结果。为此,我们提出Shapley 信用分配奖励 (SCAR),一种新方法,利用合作博弈论中的Shapley 值。SCAR 根据各组成 token 或文本片段的原则性边际贡献,将总序列奖励分配给它们。这一方法在不需训练辅助批判模型或依赖中间生成阶段的细粒度人类标注的情况下,创造出稠密奖励信号。与先前的稠密奖励方法不同,SCAR 提供了博弈论基础的公平信用归属。理论上,我们证明SCAR 保留原始最优政策;实证上,在情感控制、文本摘要和指令调优等多种任务中,我们表明SCAR 收敛速度显著更快,最终奖励得分也更高。我们的发现表明,SCAR 为 RLHF 中的信用分配提供了更有效且理论更严谨的方法,导致 LLM 一致性调优更高效。
引用
@article{arxiv.2505.20417,
title = {SCAR: Shapley Credit Assignment for More Efficient RLHF},
author = {Meng Cao and Shuyuan Zhang and Xiao-Wen Chang and Doina Precup},
journal= {arXiv preprint arXiv:2505.20417},
year = {2025}
}