迈向高性价比的奖励引导文本生成
机器学习
2025-07-08 v2 计算与语言
摘要
奖励引导文本生成(RGTG)已成为一种替代离线人类反馈强化学习(RLHF)的可行方案。RGTG 方法无需像标准 RLHF 方法那样进行进一步训练,即可将基线语言模型对齐到人类偏好。然而,它们依赖奖励模型在推理时对语言模型生成的每个候选 token 进行评分,从而产生显著的测试时开销。此外,奖励模型通常仅被训练用于对完整序列进行评分,这可能导致对部分序列做出次优选择。在本工作中,我们提出了一种新颖的奖励模型架构,该架构使用 Bradley-Terry 损失进行训练,在生成过程的每一步仅需对奖励模型进行一次调用,即可偏好序列的最优扩展。即,同时为所有可能的候选 token 生成评分,从而实现高效推理。我们在理论上分析了各种 RGTG 奖励模型,并证明在推理期间先前技术相比我们的方法更倾向于次优序列。从经验上看,我们的奖励模型比其他 RGTG 方法具有显著更快的推理速度。它需要更少的奖励模型调用次数,并且与先前的 RGTG 和离线 RLHF 方法相比具有竞争力的性能。
引用
@article{arxiv.2502.04517,
title = {Towards Cost-Effective Reward Guided Text Generation},
author = {Ahmad Rashid and Ruotian Wu and Rongqi Fan and Hongliang Li and Agustinus Kristiadi and Pascal Poupart},
journal= {arXiv preprint arXiv:2502.04517},
year = {2025}
}
备注
18 pages. Work accepted at ICML 2025