DuPO:通过双重偏好优化实现可靠的大语言模型自我验证
机器学习
2025-08-21 v1 计算与语言
摘要
我们提出了DuPO,一个基于双重学习的偏好优化框架,它通过广义对偶性生成无需标注的反馈。DuPO解决了两个关键局限性:强化学习与可验证奖励(RLVR)对昂贵标签的依赖及其仅限于可验证任务的适用性,以及传统双重学习对严格对偶任务对(例如,翻译与回译)的限制。具体而言,DuPO将原始任务的输入分解为已知和未知部分,然后构建其对偶任务,利用原始输出和已知信息重建未知部分(例如,逆向数学求解以恢复隐藏变量),从而将适用性扩展到不可逆任务。这种重建的质量作为自监督奖励来优化原始任务,并与大语言模型(LLMs)通过单一模型实例化两个任务的能力协同作用。在实证研究中,DuPO在多种任务上取得了显著提升:在756个翻译方向上平均提高了2.13 COMET,在三个挑战性基准测试上将数学推理准确率平均提高了6.4个百分点,并作为推理时重排序器将性能提升了9.3个百分点(以计算换取精度)。这些结果使DuPO成为大语言模型优化的一种可扩展、通用且无需标注的范式。
引用
@article{arxiv.2508.14460,
title = {DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization},
author = {Shuaijie She and Yu Bao and Yu Lu and Lu Xu and Tao Li and Wenhao Zhu and Shujian Huang and Shanbo Cheng and Lu Lu and Yuxuan Wang},
journal= {arXiv preprint arXiv:2508.14460},
year = {2025}
}
备注
18 pages, 4 figures,