理解与生成是否相互制约?面向统一多模态模型的 DPO 诊断研究
摘要
统一多模态模型共享语言模型主干,同时用于理解和生成图像。DPO 是否能同时对两者进行对齐?我们进行首个系统性研究,检验这一问题,将 DPO 应用于 Janus-Pro 在 1B 和 7B 参数下,采用七种训练策略和两种后处理方法。核心发现为否定结果:在本体系结构下测试的所有条件下,生成质量均抗拒 DPO 对齐。没有任何方法在 7B 参数下提升生成 CLIPScore(|Delta| < 0.2,p > 0.5,n=200/种/3 种随机种子);在 1B 参数下,所有方法都会降低生成效果,且该结果在偏好数据类型(真实-生成 vs. 模型-模型)和所测试的数据量(150-288 对)之间保持一致。梯度分析揭示原因:理解和生成梯度接近正交(cos ~ 0),且 magnitude 比例失衡约 11-14 倍,由 VQ 标记计数不对称导致(576 生成标记 vs. ~30-100 文本标记)。这种不平衡是多任务 DPO 中的主要干扰机制;进行 magnitude 平衡后,仅能获得方向性正向的理解 delta(+0.01-0.04 VQA,但个体不显著),生成差距仍然持续。我们识别出离散 VQ 标记化作为潜在结构瓶颈——由生成 DPO loss 收敛至 ln(2) 支持——并为从事 VQ 基础统一模型的实践者提供实用指导。
引用
@article{arxiv.2603.17044,
title = {Do Understanding and Generation Fight? A Diagnostic Study of DPO for Unified Multimodal Models},
author = {Abinav Rao and Sujan Rachuri},
journal= {arXiv preprint arXiv:2603.17044},
year = {2026}
}
备注
Experiments are inconclusive: The claim that architectures such as Chameleon or Emu would exhibit stronger gradient conflict is not supported by experiments or analysis, and all experiments are conducted on Janus-Pro without evaluation on other unified multimodal architectures