通过群不变学习提升人类偏好对齐的泛化能力
机器学习
2023-12-27 v3 人工智能
摘要
基于语言模型(LLMs)的 AI 助手的成功关键取决于人类反馈强化学习(RLHF),它使生成的回复更符合人类偏好。作为通用 AI 助手,人们越来越期望它们能在不同领域表现一致。然而,先前的研究表明,强化学习(RL)常常利用捷径来获取高奖励,而忽视具有挑战性的样本。这种对快速获取奖励的关注损害了训练的稳定性以及模型对新的、未见过的数据的泛化能力。在这项工作中,我们提出了一种新方法,能够通过 RL 在各种数据组或领域上学习一致的策略。鉴于获取组标注的困难,我们的方法自动将数据分类为不同的组,刻意最大化性能方差。然后,我们优化策略以在具有挑战性的组上表现良好。最后,利用已建立的组,我们的方法自适应地调整探索空间,将更多的学习能力分配给更具挑战性的数据,并防止模型在较简单的数据上过度优化。实验结果表明,我们的方法显著增强了训练稳定性和模型泛化能力。
引用
@article{arxiv.2310.11971,
title = {Improving Generalization of Alignment with Human Preferences through Group Invariant Learning},
author = {Rui Zheng and Wei Shen and Yuan Hua and Wenbin Lai and Shihan Dou and Yuhao Zhou and Zhiheng Xi and Xiao Wang and Haoran Huang and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2310.11971},
year = {2023}
}