中文

面向细粒度图像到文本检索的成对跨模态数据增强

计算机视觉与模式识别 2022-08-01 v1

摘要

本文研究一个开放研究问题:生成文本-图像对以改进细粒度图像到文本跨模态检索任务的训练,并提出了一种通过揭示StyleGAN2模型隐藏语义信息来实现成对数据增强的新框架。具体而言,我们首先在给定数据集上训练StyleGAN2模型。随后我们将真实图像投影回StyleGAN2的潜空间以获得潜码。为使生成图像可操控,我们进一步引入潜空间对齐模块,以学习StyleGAN2潜码与相应文本描述特征之间的对齐。在进行在线成对数据增强时,我们首先通过随机词元替换生成增强文本,然后将增强文本传入潜空间对齐模块以输出潜码,最终送入StyleGAN2生成增强图像。我们在两个公开跨模态检索数据集上评估了增强数据方法的有效性,其中 promising 的实验结果表明,增强的文本-图像对数据可与原始数据一同训练,以提升图像到文本跨模态检索性能。

关键词

引用

@article{arxiv.2207.14428,
  title  = {Paired Cross-Modal Data Augmentation for Fine-Grained Image-to-Text Retrieval},
  author = {Hao Wang and Guosheng Lin and Steven C. H. Hoi and Chunyan Miao},
  journal= {arXiv preprint arXiv:2207.14428},
  year   = {2022}
}

备注

Accepted at ACM MM 2022