用于视觉问答的文本增强神经模块网络
计算与语言
2018-09-25 v1 计算机视觉与模式识别
摘要
在语言与视觉交叉的问题上,如视觉问答,随着计算机视觉研究超越传统识别任务,近期在多模态机器学习领域获得了大量关注。使用深度神经网络模型、利用问题的语言结构动态实例化网络布局,在视觉问答上已取得近期成功。在将问题转换为网络布局的过程中,问题被简化,导致模型中信息丢失。本文中,我们利用图像描述与外部知识库以文本数据丰富图像信息,从而生成更连贯的答案。我们在视觉问答(VQA 1.0)真实图像数据集的 test-dev 开放式问题上取得了 57.1% 的总体准确率。
引用
@article{arxiv.1809.08697,
title = {Textually Enriched Neural Module Networks for Visual Question Answering},
author = {Khyathi Raghavi Chandu and Mary Arpita Pyreddy and Matthieu Felix and Narendra Nath Joshi},
journal= {arXiv preprint arXiv:1809.08697},
year = {2018}
}