基于注意力监督挖掘中视觉定位的可解释视觉问答
计算机视觉与模式识别
2018-08-02 v1 人工智能
计算与语言
机器学习
摘要
可解释 VQA(视觉问答)模型的一个关键方面是其将答案定位到图像中相关区域的能力。当前具备该能力的方案依赖监督学习以及人工标注的定位来训练 VQA 架构内部的注意力机制。遗憾的是,获取专用于视觉定位的人工标注既困难又昂贵。本工作中,我们证明可以有效训练带有定位监督的 VQA 架构,该监督可从已有的区域描述和对象标注中自动获得。我们还表明,使用这种挖掘得到的监督训练的模型所生成的视觉定位与人工标注定位具有更高的相关性,同时达到了最先进的 VQA 准确率。
引用
@article{arxiv.1808.00265,
title = {Interpretable Visual Question Answering by Visual Grounding from Attention Supervision Mining},
author = {Yundong Zhang and Juan Carlos Niebles and Alvaro Soto},
journal= {arXiv preprint arXiv:1808.00265},
year = {2018}
}
备注
8 pages, 4 figures