中文

用于 VQA 的视觉定位方法其实基于错误原因在起作用!

计算机视觉与模式识别 2024-04-24 v4 人工智能 计算与语言

摘要

现有的视觉问答(VQA)方法倾向于利用数据集偏差与虚假统计相关性,而非基于正确理由给出正确答案。为解决此问题,近期 VQA 的偏差缓解方法提出引入视觉线索(如人类注意力图)以更好地定位 VQA 模型,并展示了令人印象深刻的提升。然而,我们表明这些性能提升并非源于改进的视觉定位,而是一种防止过拟合语言先验的正则化效应。例如,我们发现实际上并无必要提供恰当的、基于人类的线索;随机的、无意义的线索也能带来类似的提升。基于该观察,我们提出了一种更简单的正则化方案,其不需要任何外部标注,却在 VQA-CPv2 上取得了接近最先进的性能。

关键词

引用

@article{arxiv.2004.05704,
  title  = {Visual Grounding Methods for VQA are Working for the Wrong Reasons!},
  author = {Robik Shrestha and Kushal Kafle and Christopher Kanan},
  journal= {arXiv preprint arXiv:2004.05704},
  year   = {2024}
}

备注

Published in ACL 2020 under the title "A negative case analysis of visual grounding methods for VQA"