基于计数探索的人群语言模型在线偏好对齐
机器学习
2025-02-10 v3
摘要
强化学习从人类反馈 (RLHF) 已显示出在微调大型语言模型 (LLM) 以符合人类偏好方面的巨大潜力。现有方法是从固定数据集进行偏好对齐,该数据集在覆盖范围上可能有限, resulting reward model 在超出分布响应方面难以泛化。因此,在迭代收集提示-响应对的情况下进行在线 RLHF 更可取,以使 LLM 能够探索超出初始数据集支持范围的区域。本文研究在线 RLHF 中的根本问题,即如何为 LLM 进行探索。我们在线性奖励假设下给出理论动机,表明带有上置置信区间 (UCB) 项的乐观奖励可导致可证明高效的 RLHF 策略。随后,我们将目标重新表述为带有探索项的直接偏好优化,其中 UCB 项可转换为计数型探索奖励。我们进一步提出一种实用算法,称为基于计数的在线偏好优化 (COPO),该算法利用简单的硬币翻转计数模块来估计先前收集数据中提示-响应对的伪计数。COPO 鼓励 LLM 以迭代方式平衡探索与偏好优化,从而扩大探索空间和整个 LLM 策略的数据覆盖范围。我们在 Zephyr 和 Llama-3 模型上进行了在线 RLHF 实验。关于指令遵循和标准学术基准的实验结果表明,COPO 在性能上显著提升。
引用
@article{arxiv.2501.12735,
title = {Online Preference Alignment for Language Models via Count-based Exploration},
author = {Chenjia Bai and Yang Zhang and Shuang Qiu and Qiaosheng Zhang and Kang Xu and Xuelong Li},
journal= {arXiv preprint arXiv:2501.12735},
year = {2025}
}
备注
Accepted by ICLR 2025