中文

面向对比式后训练的自动配对构建

计算与语言 2024-04-04 v2 人工智能 机器学习

摘要

对齐是引导大语言模型(LLM)朝向人类偏好的重要步骤。在本文中,我们提出一种利用不同能力强度模型(如InstructGPT、ChatGPT和GPT-4)的偏好对来自动构建LLM对比数据的方法。我们将SLiC与DPO的对比技术与SFT基线进行比较,发现即使在持续SFT已饱和之后,DPO仍带来阶跃式提升。我们还探索了一种用于对比式后训练的数据课程学习方案,从学习“较易”样本对开始并过渡到“较难”样本对,进一步改善了对齐效果。最后,我们扩大实验规模,使用更多数据与更大模型(如Orca)进行训练。值得注意的是,我们的自动对比式后训练进一步提升了Orca(一个已使用GPT-4输出微调的SOTA指令学习模型)的性能,使其超越ChatGPT。

关键词

引用

@article{arxiv.2310.02263,
  title  = {Automatic Pair Construction for Contrastive Post-training},
  author = {Canwen Xu and Corby Rosset and Ethan C. Chau and Luciano Del Corro and Shweti Mahajan and Julian McAuley and Jennifer Neville and Ahmed Hassan Awadallah and Nikhil Rao},
  journal= {arXiv preprint arXiv:2310.02263},
  year   = {2024}
}

备注

NAACL 2024 (Findings)