中文

从 $r$ 到 $Q^*$:你的语言模型其实是一个Q函数

机器学习 2024-08-14 v2

摘要

基于人类反馈的强化学习(RLHF)对于最新一代生成式AI模型的成功至关重要。鉴于经典RLHF流程的复杂性,直接对齐算法如直接偏好优化(DPO)已成为一种替代方法。尽管DPO解决了与标准RLHF设置相同的目标,但两种方法之间存在不匹配。标准RLHF在特定的token级MDP中部署强化学习,而DPO被推导为一个bandit问题,其中模型的整个响应被视为单个臂。在这项工作中,我们纠正了这一差异。我们从理论上证明,我们可以在token级MDP中将DPO推导为一种通用的逆Q学习算法,该算法满足贝尔曼方程。利用我们的理论结果,我们提供了三个具体的实证见解。首先,我们表明由于其token级解释,DPO能够执行某种类型的信用分配。其次,我们证明在token级公式下,经典的基于搜索的算法(如MCTS)最近已应用于语言生成领域,等价于DPO策略上的基于似然的搜索。经验上,我们表明简单的束搜索在基础DPO策略上产生了有意义的改进。最后,我们展示了参考策略的选择如何导致训练期间隐式奖励下降。最后,我们讨论了我们的工作的应用,包括多轮对话中的信息获取、推理、智能体应用和多模型系统的端到端训练。

关键词

引用

@article{arxiv.2404.12358,
  title  = {From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function},
  author = {Rafael Rafailov and Joey Hejna and Ryan Park and Chelsea Finn},
  journal= {arXiv preprint arXiv:2404.12358},
  year   = {2024}
}

备注

COLM 2024