中文

MixGen:一种新的多模态数据增强

计算机视觉与模式识别 2023-01-11 v3 人工智能 机器学习

摘要

数据增强是提升深度学习数据效率的必要手段。对于视觉-语言预训练,以往工作仅对图像或文本之一进行数据增强。本文提出MixGen:一种用于视觉-语言表征学习的联合数据增强,以进一步提升数据效率。它通过插值图像并拼接文本来生成语义关系得以保留的新图像-文本对。该方法简单,可即插即用地接入现有流程。我们在四种架构(包括CLIP、ViLT、ALBEF和TCL)上跨五项下游视觉-语言任务评估了MixGen,以展示其通用性与有效性。例如,在ALBEF预训练中加入MixGen带来了下游任务的绝对性能提升:图像-文本检索(COCO微调+6.2%,Flicker30K零样本+5.3%)、视觉定位(RefCOCO+ +0.9%)、视觉推理(NLVR2 +0.9%)、视觉问答(VQA2.0 +0.3%)以及视觉蕴含(SNLI-VE +0.4%)。

关键词

引用

@article{arxiv.2206.08358,
  title  = {MixGen: A New Multi-Modal Data Augmentation},
  author = {Xiaoshuai Hao and Yi Zhu and Srikar Appalaraju and Aston Zhang and Wanqian Zhang and Bo Li and Mu Li},
  journal= {arXiv preprint arXiv:2206.08358},
  year   = {2023}
}

备注

First three authors contributed equally. Code are available at https://github.com/amazon-research/mix-generation. Oral presentation at WACV 2023 Pretraining Large Vision and Multimodal Models Workshop