中文

用于视觉问答的文本增强神经模块网络

计算与语言 2018-09-25 v1 计算机视觉与模式识别

摘要

在语言与视觉交叉的问题上,如视觉问答,随着计算机视觉研究超越传统识别任务,近期在多模态机器学习领域获得了大量关注。使用深度神经网络模型、利用问题的语言结构动态实例化网络布局,在视觉问答上已取得近期成功。在将问题转换为网络布局的过程中,问题被简化,导致模型中信息丢失。本文中,我们利用图像描述与外部知识库以文本数据丰富图像信息,从而生成更连贯的答案。我们在视觉问答(VQA 1.0)真实图像数据集的 test-dev 开放式问题上取得了 57.1% 的总体准确率。

关键词

引用

@article{arxiv.1809.08697,
  title  = {Textually Enriched Neural Module Networks for Visual Question Answering},
  author = {Khyathi Raghavi Chandu and Mary Arpita Pyreddy and Matthieu Felix and Narendra Nath Joshi},
  journal= {arXiv preprint arXiv:1809.08697},
  year   = {2018}
}