中文

扩充图像-描述对:面向基于定位的视觉与语言模型的语义保持图像-描述对增强

计算机视觉与模式识别 2023-11-07 v1

摘要

基于定位的视觉与语言模型已成功应用于底层视觉任务,旨在精确位于描述中所指的物体。定位表示学习的有效性严重依赖于训练数据集的规模。尽管数据增强是一种有用的数据丰富策略,但由于图像-描述对的增强并非易事,现有视觉与语言任务中极少关注数据增强。在本研究中,我们提出了一种通过文本条件与文本无条件数据增强训练的鲁棒短语定位模型。具体而言,我们应用文本条件颜色抖动与水平翻转以确保图像与描述之间的语义一致性。为保证训练样本中图像-描述的对应,我们在应用水平翻转时根据预定义关键词修改描述。此外,受近期掩码信号重建启发,我们提出使用像素级掩码作为一种新颖的数据增强形式。虽然我们基于MDETR框架展示了我们的数据增强方法,但所提方法适用于采用其他框架的常规基于定位的视觉与语言任务。最后,我们展示了在大规模图像与语言数据集(如CLIP)上预训练的图像编码器可进一步提升结果。通过在三个常用数据集Flickr30k、指代表达式和GQA上的大量实验,我们的方法在各种指标上展示了优于最先进方法的先进性能。代码见https://github.com/amzn/augment-the-pairs-wacv2024。

关键词

引用

@article{arxiv.2311.02536,
  title  = {Augment the Pairs: Semantics-Preserving Image-Caption Pair Augmentation for Grounding-Based Vision and Language Models},
  author = {Jingru Yi and Burak Uzkent and Oana Ignat and Zili Li and Amanmeet Garg and Xiang Yu and Linda Liu},
  journal= {arXiv preprint arXiv:2311.02536},
  year   = {2023}
}

备注

Accepted to WACV2024