中文

免费的自对齐是否可能?

计算与语言 2025-02-24 v2 机器学习

摘要

对齐预训练语言模型(LMs)通常需要大规模的偏好数据和大量的计算资源。这些成本对于多目标或多元对齐来说更加高昂。这真的必要吗?我们能否仅利用内部模型能力进行高效对齐,而无需额外训练?为了回答这个问题,我们提出了AlignEZ,一种新颖的方法,它利用(1)自生成的偏好数据和(2)表示编辑来实现成本效益高、高效的对齐。通过直接操作学习到的表示,AlignEZ独立地针对不同的行为方面,而无需传统对齐方法的开销。我们的实验表明,这种成本效益高的过程提高了各种任务的性能:在通用对齐上高达19.9%,在具有挑战性的数学推理任务上高达1.9%,即使从强基模型开始也是如此。AlignEZ还可以同时将模型对齐到多个目标,从而对多个偏好轴进行细粒度控制。最后,我们表明,即使在真实偏好数据有限的情况下,AlignEZ也可以加速更昂贵的对齐过程(如DPO)。

关键词

引用

@article{arxiv.2406.03642,
  title  = {Is Free Self-Alignment Possible?},
  author = {Dyah Adila and Changho Shin and Yijing Zhang and Frederic Sala},
  journal= {arXiv preprint arXiv:2406.03642},
  year   = {2025}
}