中文

通过自奖励对比提示蒸馏直接进行大语言模型对齐

计算与语言 2024-08-16 v2

摘要

在没有人工标注偏好数据的情况下将大语言模型(LLM)与人类期望对齐是一个重要问题。在本文中,我们提出了一种方法,通过使用对比提示对下响应对的输出概率来评估响应偏好,该方法在LLaMA2-7B和LLaMA2-13B上可以实现比RLAIF更好的性能。基于此,我们提出了一种自动对齐方法,即直接大模型对齐(DLMA)。首先,我们使用对比提示对自动生成偏好数据。然后,我们继续使用对比提示对评估生成的偏好数据,并计算自奖励分数。最后,我们结合这个自奖励分数,使用DPO算法有效地对齐LLM。在实验阶段,我们的DLMA方法可以在不依赖人工标注偏好数据的情况下超越\texttt{RLHF}方法。

关键词

引用

@article{arxiv.2402.11907,
  title  = {Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt Distillation},
  author = {Aiwei Liu and Haoping Bai and Zhiyun Lu and Xiang Kong and Simon Wang and Jiulong Shan and Meng Cao and Lijie Wen},
  journal= {arXiv preprint arXiv:2402.11907},
  year   = {2024}
}

备注

24 pages, 5 pages