面向鲁棒视觉问答的反事实样本合成
计算机视觉与模式识别
2020-03-17 v1 计算与语言
多媒体
摘要
尽管视觉问答(VQA)在过去几年取得了令人印象深刻的进展,如今的 VQA 模型倾向于捕捉训练集中的表层语言相关性,并无法泛化到具有不同问答分布的测试集。为减少语言偏差,近期的若干工作引入一个仅含问题的辅助模型来正则化目标 VQA 模型的训练,并在 VQA-CP 上取得主导性性能。然而,由于设计的复杂性,当前方法无法使基于集成的模型具备理想 VQA 模型的两个不可或缺的特性:1)视觉可解释:模型在决策时应依赖于正确的视觉区域。2)问题敏感:模型应对问题中的语言变化敏感。为此,我们提出一种模型无关的反事实样本合成(CSS)训练方案。CSS 通过掩蔽图像中的关键物体或问题中的单词并赋予不同的真实答案,生成大量反事实训练样本。在用互补样本(即原始样本与生成样本)训练后,VQA 模型被迫关注所有关键物体和单词,这显著提升了视觉可解释与问题敏感能力。作为回报,这些模型的性能得到进一步提升。大量消融实验显示了 CSS 的有效性。特别地,基于 LMH 模型构建,我们在 VQA-CP v2 上取得了 58.95% 的破纪录性能,提升达 6.5%。
引用
@article{arxiv.2003.06576,
title = {Counterfactual Samples Synthesizing for Robust Visual Question Answering},
author = {Long Chen and Xin Yan and Jun Xiao and Hanwang Zhang and Shiliang Pu and Yueting Zhuang},
journal= {arXiv preprint arXiv:2003.06576},
year = {2020}
}
备注
Appear in CVPR 2020; Codes in https://github.com/yanxinzju/CSS-VQA