基于优势解耦偏好优化的视觉语言模型统一生成与自我验证
计算机视觉与模式识别
2026-01-06 v1
摘要
并行测试时扩展通常会分别训练生成和验证模型,导致高昂的训练和推理成本。我们提出了优势解耦偏好优化(ADPO),一个统一的强化学习框架,能够在单个策略中联合学习答案生成和自我验证。ADPO引入了两种创新:一种改进验证能力的偏好验证奖励,以及一种使生成和验证协同优化的解耦优化机制。具体而言,偏好验证奖励计算来自正负样本的平均验证得分作为决策阈值,提供正向反馈当预测正确性与答案正确性一致时。与此同时,优势解耦优化计算生成和验证的分离优势,应用标记掩盖隔离梯度,并组合掩码GRPO目标,保持生成质量的同时校准验证得分。ADPO在验证AUC上提高了最高可达+34.1%,推理时间降低53.5%,在MathVista/MMMU上准确率分别提高+2.8%/+1.4%,在ReasonSeg上提高1.9个cIoU,在AndroidControl/GUI Odyssey上步骤成功率分别提高+1.7%/+1.0%。
引用
@article{arxiv.2601.01483,
title = {Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization},
author = {Xinyu Qiu and Heng Jia and Zhengwen Zeng and Shuheng Shen and Changhua Meng and Yi Yang and Linchao Zhu},
journal= {arXiv preprint arXiv:2601.01483},
year = {2026}
}