CLHA:一种简单而有效的人类对齐对比学习框架
人工智能
2024-03-27 v2
摘要
基于人类反馈的强化学习 (RLHF) 是将大语言模型 (LLMs) 与人类偏好对齐的关键技术,确保这些 LLMs 以有益且可理解的方式服务于用户。然而,基于强化学习的人类对齐技术长期面临内在复杂性和训练困难的挑战。为应对这一挑战,我们提出了一种简单而有效的对比学习人类对齐框架 (CLHA),直接使 LLMs 与人类偏好对齐。CLHA 采用新颖的重打分策略,通过考虑数据的内在质量来评估数据中的噪声,并动态调整训练过程。同时,CLHA 利用成对对比损失和自适应监督微调损失,自适应地修正生成响应的似然,确保增强与人类偏好的一致性。通过使用先进方法,CLHA 超越了其他算法,在广泛使用的“有用且无害”数据集上,于奖励模型得分、自动评估和人工评估方面均展现出卓越性能。
引用
@article{arxiv.2403.16649,
title = {CLHA: A Simple yet Effective Contrastive Learning Framework for Human Alignment},
author = {Feiteng Fang and Liang Zhu and Min Yang and Xi Feng and Jinchang Hou and Qixuan Zhao and Chengming Li and Xiping Hu and Ruifeng Xu},
journal= {arXiv preprint arXiv:2403.16649},
year = {2024}
}