中文

分析视觉问答模型的行为

计算与语言 2016-10-05 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

近来,针对视觉问答(VQA)任务,已提出多种基于深度学习的模型。大多数模型的性能集中在60-70%左右。本文中,我们提出系统性方法来分析这些模型的行为,作为认识其优势与弱点、并确定最富成果的进展方向的第一步。我们分析了两个模型,分别来自VQA模型的两大主要类别——带注意力机制与不带注意力机制,并展示了这些模型行为上的异同。我们还分析了VQA Challenge 2016的获胜方案。我们的行为分析揭示,尽管近期取得了进展,当今的VQA模型仍是“目光短浅”的(倾向于在足够新颖的实例上失败),常常“急于下结论”(在“听取”问题仅一半后就收敛到预测答案),并且“固执己见”(不会因图像不同而改变其答案)。

关键词

引用

@article{arxiv.1606.07356,
  title  = {Analyzing the Behavior of Visual Question Answering Models},
  author = {Aishwarya Agrawal and Dhruv Batra and Devi Parikh},
  journal= {arXiv preprint arXiv:1606.07356},
  year   = {2016}
}

备注

13 pages, 20 figures; To appear in EMNLP 2016