通过自奖励对比提示蒸馏直接进行大语言模型对齐
计算与语言
2024-08-16 v2
摘要
在没有人工标注偏好数据的情况下将大语言模型(LLM)与人类期望对齐是一个重要问题。在本文中,我们提出了一种方法,通过使用对比提示对下响应对的输出概率来评估响应偏好,该方法在LLaMA2-7B和LLaMA2-13B上可以实现比RLAIF更好的性能。基于此,我们提出了一种自动对齐方法,即直接大模型对齐(DLMA)。首先,我们使用对比提示对自动生成偏好数据。然后,我们继续使用对比提示对评估生成的偏好数据,并计算自奖励分数。最后,我们结合这个自奖励分数,使用DPO算法有效地对齐LLM。在实验阶段,我们的DLMA方法可以在不依赖人工标注偏好数据的情况下超越\texttt{RLHF}方法。
引用
@article{arxiv.2402.11907,
title = {Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt Distillation},
author = {Aiwei Liu and Haoping Bai and Zhiyun Lu and Xiang Kong and Simon Wang and Jiulong Shan and Meng Cao and Lijie Wen},
journal= {arXiv preprint arXiv:2402.11907},
year = {2024}
}
备注
24 pages, 5 pages