中文

重建对齐改进统一多模态模型

计算机视觉与模式识别 2025-10-28 v3 人工智能 机器学习

摘要

统一多模态模型(UMMs)在单一架构内统一了视觉理解与生成。然而,传统训练依赖于图像-文本对(或序列),其描述通常稀疏且遗漏细粒度视觉细节——即使它们使用数百个词来描述一幅简单图像。我们引入了重建对齐(RecA),这是一种资源高效的后训练方法,它利用视觉理解编码器嵌入作为密集的“文本提示”,在无需描述的情况下提供丰富的监督。具体而言,RecA 使 UMM 以其自身的视觉理解嵌入为条件,并优化它以通过自监督重建损失来重建输入图像,从而重新对齐理解与生成。尽管方法简单,RecA 具有广泛适用性:在自回归、掩码自回归和基于扩散的 UMM 上,它一致地提升了生成和编辑的保真度。仅用 27 GPU 小时,使用 RecA 进行后训练就显著提升了 GenEval(0.73→0.90)和 DPGBench(80.93→88.15)上的图像生成性能,同时提高了编辑基准(ImgEdit 3.38→3.75,GEdit 6.94→7.25)。值得注意的是,RecA 超越了更大的开源模型,并广泛适用于多种 UMM 架构,确立了其作为 UMMs 高效且通用的后训练对齐策略的地位。

关键词

引用

@article{arxiv.2509.07295,
  title  = {Reconstruction Alignment Improves Unified Multimodal Models},
  author = {Ji Xie and Trevor Darrell and Luke Zettlemoyer and XuDong Wang},
  journal= {arXiv preprint arXiv:2509.07295},
  year   = {2025}
}

备注

34 pages, 28 figures and 11 tables; Update ablation study