面向 DPO 基 LM 对齐:基于策略数据的有效性始终是最佳选择吗?
人工智能
2026-01-28 v2 计算与语言
摘要
语言模型(LMs)与人类偏好相匹配对于构建可靠的 AI 系统至关重要。该问题通常被表述为优化 LM 策略以最大化反映人类偏好的预期奖励。最近,提出了 Direct Preference Optimization(DPO)作为一种直接从静态偏好数据优化策略的 LM 对齐方法,并通过纳入 on-policy 采样(即在训练循环中生成的偏好候选)进一步提高了 LM 对齐效果。然而,我们表明 on-policy 数据并非总是最优,静态和 on-policy 偏好候选之间存在系统性的有效性差异。例如,on-policy 数据在 Llama-3 上可实现约3倍的有效性,而在 Zephyr 上仅为0.4倍。为解释现象,我们提出 alignment stage 假设,将对齐过程分为两个 distinct 阶段:偏好注入阶段受益于多样化数据,而偏好微调阶段偏好高质量数据。通过理论和经验分析,我们刻画了这些阶段,并提出一种有效算法来识别它们之间的边界。我们在5个模型(Llama、Zephyr、Phi-2、Qwen、Pythia)和2种对齐方法(DPO、SLiC-HF)上进行实验,表明 alignment stage 假设具有普遍适用性,边界测量算法有效。
引用
@article{arxiv.2508.10530,
title = {Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?},
author = {Zetian Sun and Dongfang Li and Xuhui Chen and Baotian Hu and Min Zhang},
journal= {arXiv preprint arXiv:2508.10530},
year = {2026}
}
备注
Accepted by ICLR-2026