中文

面向视觉问答的语义等价对抗数据增强

计算机视觉与模式识别 2020-07-21 v1

摘要

得益于深度神经网络(DNN)的快速发展,视觉问答(VQA)取得了巨大成功。另一方面,作为DNN的主要技巧之一,数据增强已被广泛应用于许多计算机视觉任务中。然而,研究VQA数据增强问题的工作很少,且现有的基于图像的增强方案(如旋转和翻转)由于其语义结构——需要正确维持一个image,question,answer\langle image, question, answer\rangle三元组——无法直接应用于VQA。例如,若关联图像被旋转或翻转,与方向相关的问答(QA)对可能不再成立。在本文中,我们不直接操作图像和问题,而是将生成的对抗样本同时作为图像和问题的增强数据。这些增强样本不改变图像中呈现的视觉属性以及问题的\textbf{语义}含义,从而仍维持image,question,answer\langle image, question, answer\rangle的正确性。随后,我们使用对抗学习以我们的增强数据训练一个经典的VQA模型(BUTD)。我们发现,与基线模型相比,我们不仅提升了在VQAv2上的整体性能,还能有效抵御对抗攻击。源代码可在 https://github.com/zaynmi/seada-vqa 获取。

关键词

引用

@article{arxiv.2007.09592,
  title  = {Semantic Equivalent Adversarial Data Augmentation for Visual Question Answering},
  author = {Ruixue Tang and Chao Ma and Wei Emma Zhang and Qi Wu and Xiaokang Yang},
  journal= {arXiv preprint arXiv:2007.09592},
  year   = {2020}
}

备注

To appear in ECCV 2020