Step-On-Feet Tuning:通过自举扩展大语言模型的自对齐
计算与语言
2024-06-28 v3 人工智能
摘要
自对齐是一种在确保模型具备良好能力的同时降低人工标注成本的有效方法。然而,大多数现有方法在单轮中完成数据收集和训练步骤,这可能忽略了自对齐模型持续提升的能力。这引出了一个关键问题:如果我们进行多轮自举自对齐会怎样?这种策略是会增强模型性能还是导致快速退化?在本文中,我们开创性地探索了自举自对齐对大语言模型的影响。我们的研究结果表明,通过保证来自上下文学习的数据多样性,自举自对齐显著优于单轮方法。为了进一步挖掘自举的潜力,我们研究并调整了数据的训练顺序,从而提升了模型性能。基于这些发现,我们提出了 Step-On-Feet Tuning (SOFT),该方法利用模型不断增强的少样本能力来提升零样本或单样本性能。基于由易到难的训练策略,我们提出了 SOFT+,进一步提升了自对齐的性能。我们的实验证明了 SOFT(及 SOFT+)在各种分类和生成任务中的有效性,突显了自举自对齐在持续提升模型对齐性能方面的潜力。
引用
@article{arxiv.2402.07610,
title = {Step-On-Feet Tuning: Scaling Self-Alignment of LLMs via Bootstrapping},
author = {Haoyu Wang and Guozheng Ma and Ziqiao Meng and Zeyu Qin and Li Shen and Zhong Zhang and Bingzhe Wu and Liu Liu and Yatao Bian and Tingyang Xu and Xueqian Wang and Peilin Zhao},
journal= {arXiv preprint arXiv:2402.07610},
year = {2024}
}