中文

DALL-E 与 Flamingo 能相互理解吗?

计算机视觉与模式识别 2023-08-22 v2 机器学习

摘要

专注于理解和创作图像与文本的多模态研究领域取得了显著进展。这一进展体现在致力于大规模图像描述的复杂模型的出现,例如著名的 Flamingo 模型,以及以 DALL-E 为突出代表的文本到图像生成模型。该领域中一个值得探索的有趣问题是,Flamingo 和 DALL-E 是否能相互理解。为了研究这个问题,我们提出了一个重建任务,其中 Flamingo 为给定图像生成描述,而 DALL-E 使用该描述作为输入来合成新图像。我们认为,如果生成的图像与给定图像相似,则这些模型相互理解。具体而言,我们研究了图像重建质量与文本生成质量之间的关系。我们发现,图像的最佳描述是能够生成与原图相似图像的描述。这一发现促使我们提出了一个统一框架来微调文本到图像和图像到文本模型。具体而言,重建部分构成了一个正则化损失,用于指导模型的调优。在多个数据集上使用不同图像描述和图像生成模型进行的广泛实验验证了我们的发现,并证明了我们提出的统一框架的有效性。由于 DALL-E 和 Flamingo 未公开可用,我们在后续工作中使用 Stable Diffusion 和 BLIP。项目网站:https://dalleflamingo.github.io。

关键词

引用

@article{arxiv.2212.12249,
  title  = {Do DALL-E and Flamingo Understand Each Other?},
  author = {Hang Li and Jindong Gu and Rajat Koner and Sahand Sharifzadeh and Volker Tresp},
  journal= {arXiv preprint arXiv:2212.12249},
  year   = {2023}
}

备注

Accepted to ICCV 2023