通过对比学习支付对齐税
机器学习
2025-05-27 v1
摘要
当前的去偏方法通常会导致模型能力退化,例如事实准确性和知识保留。通过对多个基准测试的系统评估,我们证明现有的去偏方法面临基本的权衡,特别是在较小模型中,导致真实性降低、知识丢失或输出不可理解。为了解决这些局限性,我们提出了一种对比学习框架,通过精心构建的正例和负例进行学习。我们的方法引入了对比计算和动态损失缩放,以在缓解偏见与保持忠实性之间取得平衡。在多个模型规模上的实验结果表明,我们的方法在降低毒性和保持忠实性方面均取得了显著改善。最重要的是,我们表明我们的框架是首个同时持续改善这两个指标的方法,避免了现有方法特有的能力退化。这些结果表明,通过对比学习对正例和负例进行显式建模,可能是减少语言模型去偏中的对齐税的一个有前景的方向。
引用
@article{arxiv.2505.19327,
title = {Paying Alignment Tax with Contrastive Learning},
author = {Buse Sibel Korkmaz and Rahul Nair and Elizabeth M. Daly and Antonio del Rio Chanona},
journal= {arXiv preprint arXiv:2505.19327},
year = {2025}
}