中文

理解与生成是否相互制约?面向统一多模态模型的 DPO 诊断研究

机器学习 2026-05-26 v2 人工智能 计算机视觉与模式识别

摘要

统一多模态模型共享语言模型主干,同时用于理解和生成图像。DPO 是否能同时对两者进行对齐?我们进行首个系统性研究,检验这一问题,将 DPO 应用于 Janus-Pro 在 1B 和 7B 参数下,采用七种训练策略和两种后处理方法。核心发现为否定结果:在本体系结构下测试的所有条件下,生成质量均抗拒 DPO 对齐。没有任何方法在 7B 参数下提升生成 CLIPScore(|Delta| < 0.2,p > 0.5,n=200/种/3 种随机种子);在 1B 参数下,所有方法都会降低生成效果,且该结果在偏好数据类型(真实-生成 vs. 模型-模型)和所测试的数据量(150-288 对)之间保持一致。梯度分析揭示原因:理解和生成梯度接近正交(cos ~ 0),且 magnitude 比例失衡约 11-14 倍,由 VQ 标记计数不对称导致(576 生成标记 vs. ~30-100 文本标记)。这种不平衡是多任务 DPO 中的主要干扰机制;进行 magnitude 平衡后,仅能获得方向性正向的理解 delta(+0.01-0.04 VQA,但个体不显著),生成差距仍然持续。我们识别出离散 VQ 标记化作为潜在结构瓶颈——由生成 DPO loss 收敛至 ln(2) 支持——并为从事 VQ 基础统一模型的实践者提供实用指导。

关键词

引用

@article{arxiv.2603.17044,
  title  = {Do Understanding and Generation Fight? A Diagnostic Study of DPO for Unified Multimodal Models},
  author = {Abinav Rao and Sujan Rachuri},
  journal= {arXiv preprint arXiv:2603.17044},
  year   = {2026}
}

备注

Experiments are inconclusive: The claim that architectures such as Chameleon or Emu would exhibit stronger gradient conflict is not supported by experiments or analysis, and all experiments are conducted on Janus-Pro without evaluation on other unified multimodal architectures