用于 VQA 的视觉定位方法其实基于错误原因在起作用!
计算机视觉与模式识别
2024-04-24 v4 人工智能
计算与语言
摘要
现有的视觉问答(VQA)方法倾向于利用数据集偏差与虚假统计相关性,而非基于正确理由给出正确答案。为解决此问题,近期 VQA 的偏差缓解方法提出引入视觉线索(如人类注意力图)以更好地定位 VQA 模型,并展示了令人印象深刻的提升。然而,我们表明这些性能提升并非源于改进的视觉定位,而是一种防止过拟合语言先验的正则化效应。例如,我们发现实际上并无必要提供恰当的、基于人类的线索;随机的、无意义的线索也能带来类似的提升。基于该观察,我们提出了一种更简单的正则化方案,其不需要任何外部标注,却在 VQA-CPv2 上取得了接近最先进的性能。
引用
@article{arxiv.2004.05704,
title = {Visual Grounding Methods for VQA are Working for the Wrong Reasons!},
author = {Robik Shrestha and Kushal Kafle and Christopher Kanan},
journal= {arXiv preprint arXiv:2004.05704},
year = {2024}
}
备注
Published in ACL 2020 under the title "A negative case analysis of visual grounding methods for VQA"