中文

广泛自对比实现无反馈语言模型对齐

计算与语言 2024-04-02 v1 人工智能 机器学习

摘要

基于人类反馈的强化学习(RLHF)一直是近期大语言模型(LLM)对齐的核心技术。然而,其对昂贵的人类或 LLM-as-Judge 偏好反馈的严重依赖可能阻碍其更广泛的应用。在本工作中,我们引入了 Self-Contrast,一种通过利用广泛的自生成负样本实现无反馈大语言模型对齐的方法。仅使用监督微调(SFT)目标,Self-Contrast 利用 LLM 本身生成大量多样化候选样本,并利用预训练嵌入模型根据文本相似度筛选出多个负样本。在理论上,我们阐明了在此设定下,仅扩展负样本响应仍能有效近似具有更平衡正负偏好标注的情形。我们在三个数据集上使用直接偏好优化(DPO)的实验表明,Self-Contrast 能够以较大优势持续超越 SFT 和标准 DPO 训练。并且随着自生成负样本数量的增加,Self-Contrast 的性能持续提升。代码和数据可在 https://github.com/THUDM/Self-Contrast 获取。

关键词

引用

@article{arxiv.2404.00604,
  title  = {Extensive Self-Contrast Enables Feedback-Free Language Model Alignment},
  author = {Xiao Liu and Xixuan Song and Yuxiao Dong and Jie Tang},
  journal= {arXiv preprint arXiv:2404.00604},
  year   = {2024}
}