分析视觉问答模型的行为
计算与语言
2016-10-05 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
近来,针对视觉问答(VQA)任务,已提出多种基于深度学习的模型。大多数模型的性能集中在60-70%左右。本文中,我们提出系统性方法来分析这些模型的行为,作为认识其优势与弱点、并确定最富成果的进展方向的第一步。我们分析了两个模型,分别来自VQA模型的两大主要类别——带注意力机制与不带注意力机制,并展示了这些模型行为上的异同。我们还分析了VQA Challenge 2016的获胜方案。我们的行为分析揭示,尽管近期取得了进展,当今的VQA模型仍是“目光短浅”的(倾向于在足够新颖的实例上失败),常常“急于下结论”(在“听取”问题仅一半后就收敛到预测答案),并且“固执己见”(不会因图像不同而改变其答案)。
引用
@article{arxiv.1606.07356,
title = {Analyzing the Behavior of Visual Question Answering Models},
author = {Aishwarya Agrawal and Dhruv Batra and Devi Parikh},
journal= {arXiv preprint arXiv:1606.07356},
year = {2016}
}
备注
13 pages, 20 figures; To appear in EMNLP 2016