用于大语言模型对齐的近似变分贝叶斯逆强化学习
机器学习
2024-11-15 v1
摘要
大语言模型(LLM)的对齐对于生成有用且无害的内容至关重要。现有方法利用基于偏好的人类反馈数据来学习奖励函数,并使 LLM 与反馈数据对齐。然而,这些方法侧重于建模所选演示与被拒绝演示之间的奖励差异,而非直接从每个演示中建模真实奖励。此外,这些方法假设奖励仅在句子末尾获得,忽略了对中间奖励的建模。这些问题导致反馈数据中的训练信号未被充分利用,限制了奖励的表示和泛化能力,并可能导致奖励黑客攻击。在本文中,我们将 LLM 对齐表述为贝叶斯逆强化学习(BIRL)问题,并提出了一种新的训练目标,即近似变分对齐(AVA),通过近似变分奖励模仿学习(AVRIL)来执行 LLM 对齐。BIRL 公式促进了中间奖励建模以及对每个单一演示的直接奖励建模,从而增强了反馈数据中训练信号的利用率。实验表明,AVA 在奖励建模、强化学习微调和直接优化方面均优于现有的 LLM 对齐方法。
引用
@article{arxiv.2411.09341,
title = {Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment},
author = {Yuang Cai and Yuyu Yuan and Jinsheng Shi and Qinhong Lin},
journal= {arXiv preprint arXiv:2411.09341},
year = {2024}
}