基于词性标注引导注意力与结构化三元组学习的视觉问答方法
计算机视觉与模式识别
2018-01-25 v1
摘要
视觉问答(VQA)因有望成为图像理解系统的有力测试手段并探究语言与视觉之间的联系而备受关注。尽管近期取得了诸多进展,通用 VQA 仍远未得到解决。本文关注 VQA 多选题任务,并提供了设计能够有效捕捉语言-视觉交互并进行联合推理的 VQA 模型的一些良好实践。我们探索了融合词性(POS)标注引导注意力、卷积 n-gram、图像-问题-候选答案之间的三元组注意力交互,以及基于图像-问题对的三元组结构化学习的机制。我们在两个流行数据集 Visual7W 和 VQA Real Multiple Choice 上评估了模型。我们的最终模型在 Visual7W 上取得了 68.2% 的当前最优性能,并在 VQA Real Multiple Choice 的 test-standard 划分上取得了极具竞争力的 69.6% 性能。
引用
@article{arxiv.1801.07853,
title = {Structured Triplet Learning with POS-tag Guided Attention for Visual Question Answering},
author = {Zhe Wang and Xiaoyi Liu and Liangjian Chen and Limin Wang and Yu Qiao and Xiaohui Xie and Charless Fowlkes},
journal= {arXiv preprint arXiv:1801.07853},
year = {2018}
}
备注
8 pages, 5 figures, state-of-the-art VQA system; https://github.com/wangzheallen/STL-VQA