中文

有些事物比其他更令人尴尬:基于成对Cringe损失的迭代偏好优化

计算与语言 2024-04-24 v2 人工智能

摘要

从业者通常使用成对偏好来对齐大型语言模型,即给定标签“对于给定输入,响应A优于响应B”。也许不那么常见的是,也开发了用于二元反馈的方法,即根据“响应A好或坏”的标签训练模型。我们展示了如何将现有的高性能二元反馈方法——Cringe损失(Adolphs等人,2022)——通过简单的软间隔扩展推广到成对偏好设置。成对Cringe损失易于实现且训练高效,我们发现它在AlpacaFarm基准上优于PPO和DPO等最先进的偏好优化算法。我们表明,模型的迭代训练对于改进结果很重要,并且我们可以以相同的方式将DPO推广到迭代DPO。

关键词

引用

@article{arxiv.2312.16682,
  title  = {Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss},
  author = {Jing Xu and Andrew Lee and Sainbayar Sukhbaatar and Jason Weston},
  journal= {arXiv preprint arXiv:2312.16682},
  year   = {2024}
}