中文

通过循环一致性利用非配对数据训练视觉-语言生成模型

计算机视觉与模式识别 2023-10-06 v1

摘要

当前的视觉-语言生成模型依赖庞大的配对图像-文本数据语料,以获得最优性能与泛化能力。然而,自动收集此类数据(例如通过大规模网络抓取)会导致质量低下且图文相关性差,而人工标注虽更准确却需大量人力与开销。我们提出 ITIT\textbf{ITIT}I\textbf{I}nT\textbf{T}egrating I\textbf{I}mage T\textbf{T}ext,集成图像文本):一种基于循环一致性概念的创新训练范式,可在非配对图像与文本数据上进行视觉-语言训练。ITIT 由一个共享图像-文本编码器与分离的图像、文本解码器组成,可在单一框架中实现双向图像到文本与文本到图像的生成。训练期间,ITIT 利用少量配对图像-文本数据确保两个方向的输出与输入合理匹配;同时,模型也在仅含图像或仅含文本的更大数据集上训练,通过对原始非配对样本与循环生成样本之间强制循环一致性来实现。例如,其为给定输入图像生成描述文本,再用该文本生成输出图像,并强制输入与输出图像之间的相似性。我们的实验表明,使用非配对数据集的 ITIT 展现出与采用高质量配对数据相似的缩放行为。我们展示了在少得多(仅 3M)的配对图像-文本数据下,图像生成与描述性能可与最先进的文本到图像及图像到文本模型相媲美。

关键词

引用

@article{arxiv.2310.03734,
  title  = {Leveraging Unpaired Data for Vision-Language Generative Models via Cycle Consistency},
  author = {Tianhong Li and Sangnie Bhardwaj and Yonglong Tian and Han Zhang and Jarred Barber and Dina Katabi and Guillaume Lajoie and Huiwen Chang and Dilip Krishnan},
  journal= {arXiv preprint arXiv:2310.03734},
  year   = {2023}
}