KL正则化Q学习:在线RLHF的令牌级动作价值视角
计算与语言
2025-08-26 v1 机器学习
摘要
近端策略优化(PPO)是一种用于语言模型基于人类反馈的强化学习(LM-RLHF)的成熟且有效的策略梯度算法。PPO在经验上表现良好,但其动机是启发式的,并以临时方式处理LM-RLHF中使用的KL散度约束。在本文中,我们为LM-RLHF设定开发了一种新的动作价值强化学习方法——KL正则化Q学习(KLQ)。我们随后证明,尽管动机截然不同,我们的方法在某种意义上等价于PPO的一个版本。最后,我们在两个关键语言生成任务——摘要和单轮对话上对KLQ进行了基准测试。我们证明KLQ在优化LM-RLHF目标上与PPO表现相当,并且在LLM-as-a-judge评估中持续取得更高的胜率。
引用
@article{arxiv.2508.17000,
title = {KL-Regularised Q-Learning: A Token-level Action-Value perspective on Online RLHF},
author = {Jason R Brown and Lennie Wells and Edward James Young and Sergio Bacallado},
journal= {arXiv preprint arXiv:2508.17000},
year = {2025}
}