SIMPLEMIX:语言模型偏好学习中离策略与在策略数据的极简混合方法
计算与语言
2025-05-06 v1
摘要
将语言模型与人类偏好对齐依赖于成对偏好数据集。虽然一些研究表明,在策略数据在偏好学习中始终优于离策略数据,但另一些研究则指出,在策略数据的优势可能取决于任务,这凸显了系统探索两者相互作用的需求。在这项工作中,我们表明在策略和离策略数据在偏好优化中提供了互补的优势:在策略数据对数学和编程等推理任务特别有效,而离策略数据在创意写作和提出个人建议等开放式任务上表现更佳。基于这些发现,我们引入了 SIMPLEMIX,这是一种通过简单混合这两种数据源来结合在策略和离策略偏好学习互补优势的方法。我们在不同任务和基准上的实证结果表明,SIMPLEMIX 显著改善了语言模型的对齐效果。具体而言,在 Alpaca Eval 2.0 上,SIMPLEMIX 比在策略 DPO 和离策略 DPO 平均提高了 6.03%。此外,它比先前结合在策略和离策略数据的更复杂方法(如 HyPO 和 DPO-Mix-P)平均高出 3.05%。
引用
@article{arxiv.2505.02363,
title = {SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning},
author = {Tianjian Li and Daniel Khashabi},
journal= {arXiv preprint arXiv:2505.02363},
year = {2025}
}
备注
To appear in ICML 2025