中文

BRAIn:基于反馈的自然语言生成的贝叶斯奖励条件化摊销推断

机器学习 2024-06-11 v2 人工智能 计算与语言 人机交互

摘要

诸如分布控制生成(GDC)和分布策略梯度(DPG)等用于语言模型对齐的分布匹配方法,在人类反馈强化学习(RLHF)中并未获得与序列似然校准(SLiC)、直接偏好优化(DPO)及其变体等对比方法同等的关注。我们将梯度估计的高方差确定为这些方法缺乏成功的主要原因,并提出一种自归一化基线以降低方差。我们进一步利用贝叶斯规则定义奖励条件化后验,从而推广了 DPG、GDC 和 DPO 中的目标分布。所得方法称为 BRAIn(贝叶斯奖励条件化摊销推断),它充当了分布匹配方法与 DPO 之间的桥梁,并在摘要和 Anthropic HH 任务上显著优于先前的方法。

关键词

引用

@article{arxiv.2402.02479,
  title  = {BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback},
  author = {Gaurav Pandey and Yatin Nandwani and Tahira Naseem and Mayank Mishra and Guangxuan Xu and Dinesh Raghu and Sachindra Joshi and Asim Munawar and Ramón Fernandez Astudillo},
  journal= {arXiv preprint arXiv:2402.02479},
  year   = {2024}
}

备注

Accepted at ICML 2024 (main conference)