SeaPO:用于大型语言模型鲁棒偏好优化的策略性误差放大
计算与语言
2025-09-30 v1
摘要
现有的大型语言模型(LLMs)偏好优化对齐方法旨在通过利用正负样本对来提升模型性能。然而,由于模型在打分或生成响应方面的能力有限,正负样本的质量在训练过程中可能变得相似,这使偏好学习的优化变得复杂。为了解决这个问题,我们引入了SeaPO,一种策略性误差放大方法,该方法利用LLMs中常见的三种误差类型,将特定的误差模式引入模型偏好优化中。这一策略确保负样本比正样本包含更多误差,并采用基于偏好的训练来减轻这些误差的发生,从而提升模型性能。在五个能力维度和不同模型规模(1.5B到14B)上的评估表明,生成的数据显著提升了模型整体性能,特别是在真实性方面,观察到5-10个百分点的提升。进一步分析表明,任务性能因引入的误差类型而异。注入最常见的误差类型可提升相关任务的性能,而混合误差类型则带来更广泛的性能提升:大多数任务表现出稳定提升,少数任务则展现出显著收益。
引用
@article{arxiv.2509.24781,
title = {SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models},
author = {Jun Rao and Yunjie Liao and Xuebo Liu and Zepeng Lin and Lian Lian and Dong Jin and Shengjun Cheng and Jun Yu and Min Zhang},
journal= {arXiv preprint arXiv:2509.24781},
year = {2025}
}
备注
EMNLP 2025 Findings