中文

面向视觉与语言表示学习的大规模对抗训练

计算机视觉与模式识别 2020-10-26 v2 计算与语言 机器学习

摘要

我们提出 VILLA,这是已知首个面向视觉与语言(V+L)表示学习的大规模对抗训练工作。VILLA 包含两个训练阶段:(i)任务无关的对抗预训练;随后(ii)任务特定的对抗微调。我们未在图像像素和文本词元上添加对抗扰动,而是提出在各模态的嵌入空间中进行对抗训练。为实现大规模训练,我们采用“free”对抗训练策略,并将其与基于 KL 散度的正则化结合,以提升嵌入空间中更高的不变性。我们将 VILLA 应用于当前性能最佳的 V+L 模型,并在广泛任务上取得新的最优结果,包括视觉问答、视觉常识推理、图文检索、指代表达理解、视觉蕴含以及 NLVR2。

关键词

引用

@article{arxiv.2006.06195,
  title  = {Large-Scale Adversarial Training for Vision-and-Language Representation Learning},
  author = {Zhe Gan and Yen-Chun Chen and Linjie Li and Chen Zhu and Yu Cheng and Jingjing Liu},
  journal= {arXiv preprint arXiv:2006.06195},
  year   = {2020}
}

备注

NeurIPS 2020 Spotlight paper