BPO:保持接近 LLM 创建的行为更好地实现在线 LLM 对齐
机器学习
2024-10-23 v4 人工智能
计算与语言
摘要
直接从偏好数据进行对齐 (Direct Alignment from Preferences, DAP) 已成为一种引导大型语言模型 (LLM) 符合人类需求的有前景的方法,这些需求从预收集的、离线的偏好数据集中提炼出来。虽然最近的研究表明现有的离线 DAP 方法可以从在线训练样本中直接获益,但我们指出需要开发特定的在线 DAP 算法才能充分发挥在线训练的潜力。具体而言,我们确定应该学习的 LLM 应遵循行为 LLM 的接近程度,而该行为 LLM 收集了训练样本。为此,我们提出一种基于行为 LLM 的在线偏好优化 (BPO),强调构建适当信任区域以实现 LLM 对齐的重要性。我们进行了大量实验,以验证我们方法的有效性和适用性,通过将其集成到各种 DAP 方法中,在使用相同数量的偏好数据的情况下,在广泛的任务中实现显著的性能提升。即使仅引入一个额外的数据收集阶段,我们的在线 BPO 也会将其离线 DAP 基线在 TL;DR 和 Anthropic Helpfulness 上的胜率提升,从 72.0% 提升到 80.2%,从 82.2% 提升到 89.1%(相对于人类参考文本)。
引用
@article{arxiv.2406.12168,
title = {BPO: Staying Close to the Behavior LLM Creates Better Online LLM Alignment},
author = {Wenda Xu and Jiachen Li and William Yang Wang and Lei Li},
journal= {arXiv preprint arXiv:2406.12168},
year = {2024}
}
备注
Wenda Xu and Jiachen Li contributed equally. Accepted by EMNLP 2024