带 KL 惩罚的 RL 更宜视为贝叶斯推断
机器学习
2022-10-24 v2 机器学习
摘要
强化学习(RL)常被用于微调大语言模型(LM),如 GPT-3,以惩罚生成序列中诸如冒犯性、社会偏见、有害性或虚假性等不良特征。RL 公式将 LM 视为策略,并更新之以最大化捕获人类偏好(如非冒犯性)的奖励函数的期望值。本文中,我们分析将语言模型作为 RL 策略所带来的挑战,并展示如何超越 RL 范式以避免这些挑战。我们首先观察到,标准 RL 方法作为微调 LM 的目标是有缺陷的,因为它会导致分布坍缩:使 LM 退化为退化分布。随后,我们分析广泛用于微调 LM 的 KL 正则化 RL,它额外约束微调后的 LM 在 Kullback-Leibler (KL) 散度意义上与其原始分布保持接近。我们证明 KL 正则化 RL 等价于变分推断:近似一个贝叶斯后验,该后验规定了如何更新先验 LM 以符合奖励函数所提供的证据。我们认为,这种 KL 正则化 RL 的贝叶斯推断视角比通常采用的 RL 视角更具洞察力。贝叶斯推断视角解释了 KL 正则化 RL 如何避免分布坍缩问题,并为其目标提供了第一性原理推导。尽管该目标恰好等价于 RL(在特定参数化奖励选择下),但存在其他不再等价于 RL 的 LM 微调目标。该观察引向一个更普遍的观点:RL 并非诸如语言模型微调等问题的恰当形式框架。这些问题最好被视为贝叶斯推断:近似一个预定义的目标分布。
引用
@article{arxiv.2205.11275,
title = {RL with KL penalties is better viewed as Bayesian inference},
author = {Tomasz Korbak and Ethan Perez and Christopher L Buckley},
journal= {arXiv preprint arXiv:2205.11275},
year = {2022}
}
备注
Findings of EMNLP 2022