利用扩散模型的图像描述多模态数据增强
计算机视觉与模式识别
2023-11-14 v1 人工智能
摘要
图像描述是一项重要的视觉-语言任务,通常需要大量精细标注的图像-描述对来学习图像与文本之间的底层对齐关系。本文中,我们提出了一种多模态数据增强方法,利用近期称为 Stable Diffusion 的文本到图像模型,通过高质量生成图像-描述对来扩充训练集。在 MS COCO 数据集上的大量实验证明了我们的方法相对于若干基准方法的优势,尤其在训练实例较少时提升显著。此外,在我们增强数据集上训练的模型也大幅优于先前的非配对图像描述方法。最后,在基于质量评估对生成数据进行有意的过滤后,可进一步提升训练的效率与效果。
引用
@article{arxiv.2305.01855,
title = {Multimodal Data Augmentation for Image Captioning using Diffusion Models},
author = {Changrong Xiao and Sean Xin Xu and Kunpeng Zhang},
journal= {arXiv preprint arXiv:2305.01855},
year = {2023}
}