迈向因果VQA:通过不变与协变语义编辑揭示并削弱伪相关
计算机视觉与模式识别
2020-06-01 v3 计算与语言
机器学习
摘要
尽管视觉问答(VQA)取得了显著成功,但已表明VQA模型对问题中的语言变化异常脆弱。由于模型与数据集的缺陷,当今的模型往往依赖于与数据因果无关的相关性而非预测。本文中,我们提出一种新颖方法来分析与度量最先进模型关于语义视觉变化的鲁棒性,并提出了使模型对伪相关更具鲁棒性的途径。我们的方法执行自动语义图像操控并测试模型预测的一致性,以量化模型鲁棒性并生成合成数据来应对这些问题。我们在三种多样的最先进VQA模型及多样问题类型上进行了分析,特别关注具有挑战性的计数问题。此外,我们展示了利用我们的编辑数据可使模型对不一致预测显著更具鲁棒性。最后,我们展示了结果也适用于最先进模型的真实世界错误案例,从而带来整体性能的提升。
引用
@article{arxiv.1912.07538,
title = {Towards Causal VQA: Revealing and Reducing Spurious Correlations by Invariant and Covariant Semantic Editing},
author = {Vedika Agarwal and Rakshith Shetty and Mario Fritz},
journal= {arXiv preprint arXiv:1912.07538},
year = {2020}
}
备注
16 pages