InCo-DPO:平衡分布迁移与数据质量的增强型偏好优化
机器学习
2025-03-21 v1 计算与语言
摘要
直接偏好优化(DPO)用于对齐语言模型以符合人类偏好。利用模型生成的在策略数据(on-policy samples),由于其与模型分布的一致性,通常表现更好。本文识别了候选偏好样本质量作为另一个关键因素。虽然模型能力受限于策略模型,但来自多样化来源的离策略数据(off-policy samples)在质量方面具有更大的潜力,尽管会经历分布迁移。然而,当前研究大多依赖于策略数据,忽略了因分布迁移的挑战而在数据质量方面的价值。本文提出InCo-DPO,通过整合策略数据和离策略数据来合成偏好数据,实现动态平衡分布迁移与数据质量,从而找到最佳权衡。Consequently,InCo-DPO克服了离策略数据中分布迁移的局限性以及策略数据中质量约束。我们使用Alpaca-Eval 2.0和Arena-Hard基准测试评估了InCo-DPO。实验结果表明,我们的方法不仅优于策略数据和离策略数据,还在使用Gemma-2模型的基础DPO上实现了60.8%的SOTA胜率。
引用
@article{arxiv.2503.15880,
title = {InCo-DPO: Balancing Distribution Shift and Data Quality for Enhanced Preference Optimization},
author = {Yunan Wang and Jijie Li and Bo-Wen Zhang and Liangdong Wang and Guang Liu},
journal= {arXiv preprint arXiv:2503.15880},
year = {2025}
}