利用内部差距实现自我提升:促进MLLMs中的生成-理解统一
计算与语言
2025-09-26 v2 人工智能
摘要
虽然统一的多模态大语言模型(MLLMs)旨在统一生成与理解,但它们被认为存在内部差距,表现为理解优于生成。通过对多种MLLMs和任务进行大规模评估,我们确认了MLLMs普遍存在非统一现象,并证明了这一现象确实源于生成能力较弱而非理解不足。基于此,我们提出了一种简单而有效的基于内部差距的自我提升框架,通过利用更强的理解能力指导较弱的生成能力,而无需依赖外部信号,从而缓解内部差距。我们通过全面实验验证了该策略的有效性:使用理解对生成进行打分,以构建用于后训练(如SFT和DPO)的图像数据,显著提升生成性能并促进统一。进一步地,我们经验性地发现了这种自我提升的协同提升效应——即随着生成能力的提升,理解能力也更有效地识别了之前被误分类为与提示一致的假阳性结果。为解释这一效应,我们将学习动态理论扩展到MLLMs情境,表明生成与理解之间共享的经验神经切片核(NTK)鼓励对齐的学习动力学,从而推动协同提升。这种生成与理解之间的相互作用进一步激励了一种课程学习方法,以实现更强的自我提升:逐步增强的理解与生成回访由预训练MLLMs underutilization的样本,动态扩充后训练数据,导致性能提升和统一。
引用
@article{arxiv.2507.16663,
title = {Turning Internal Gap into Self-Improvement: Promoting the Generation-Understanding Unification in MLLMs},
author = {Yujin Han and Hao Chen and Andi Han and Zhiheng Wang and Xinyu Liu and Yingya Zhang and Shiwei Zhang and Difan Zou},
journal= {arXiv preprint arXiv:2507.16663},
year = {2025}
}
备注
31 pages, 16 figures, 12 tables