中文

自对弈语言模型的正则化研究

机器学习 2024-04-09 v1

摘要

本文探讨了在通过自对弈进行语言模型对齐的背景下各种形式正则化的效果。虽然从人类反馈中强化学习(RLHF)和直接偏好优化(DPO)都需要收集昂贵的人工标注成对偏好,但自对弈微调(SPIN)方法通过用前一次迭代生成的数据替换被拒绝的答案。然而,SPIN方法在学习阶段存在性能不稳定的问题,这可以通过与之前两次迭代的混合体进行对弈来缓解。同样,我们在本文中提出从两个角度解决这个问题:第一,通过引入额外的Kullback-Leibler(KL)正则化以保持接近参考策略;第二,通过使用虚拟博弈的思想,该思想使对手策略在所有先前迭代中变得平滑。特别地,我们表明基于KL的正则化归结为在SPIN损失函数内用其与基础策略的几何混合替换前一次策略。最后,我们讨论了在MT-Bench以及Hugging Face Open LLM Leaderboard上的实证结果。

关键词

引用

@article{arxiv.2404.04291,
  title  = {Investigating Regularization of Self-Play Language Models},
  author = {Reda Alami and Abdalgader Abubaker and Mastane Achab and Mohamed El Amine Seddik and Salem Lahlou},
  journal= {arXiv preprint arXiv:2404.04291},
  year   = {2024}
}