中文

GMAIL:面向生成图像学习的生成式模态对齐

计算机视觉与模式识别 2026-02-18 v1 人工智能 机器学习 图像与视频处理

摘要

生成模型使得合成高度逼真的图像成为可能, potentially 为训练机器学习模型提供丰富的数据源。尽管这些可合成数据源具有优势,但在不加区分地将生成图像当作真实图像进行训练时,由于真实域与合成域之间的模态差异,甚至可能导致模式崩溃。本文提出一种新颖框架用于对生成图像进行判别性使用,称为GMAIL,该框架将生成图像明确地视为与真实图像不同的模态。本文不在像素空间中不加区分地用生成图像替换真实图像,而是通过多模态学习方法在相同的潜空间中搭建两种不同模态。具体而言,本文首先仅使用交叉模态对齐损失对模型进行精调,然后利用对齐后的模型进一步训练各种视觉语言模型。通过对齐两种模态,本方法有效地利用了最新生成模型的优势,从而提升了跨各种视觉语言任务的生成图像学习效果。该框架可以轻松集成到各种视觉语言模型中,并在大量实验中展示了其有效性。例如,本框架在图像字幕生成、零样本图像检索、零样本图像分类和长字幕检索任务上性能显著提升。它还显示出生成数据规模提升的正相关趋势,以及在大型多模态模型LLaVA的字幕生成性能方面显著的增强。

关键词

引用

@article{arxiv.2602.15368,
  title  = {GMAIL: Generative Modality Alignment for generated Image Learning},
  author = {Shentong Mo and Sukmin Yun},
  journal= {arXiv preprint arXiv:2602.15368},
  year   = {2026}
}