中文

面向视觉问答的文本感知双路由网络

计算机视觉与模式识别 2022-11-29 v1 人工智能

摘要

视觉问答(VQA)是一项具有挑战性的任务,旨在给定一幅图像和关于该图像的自然语言问题后提供准确的自然语言答案。它涉及多模态学习,即计算机视觉(CV)与自然语言处理(NLP),以及对自由形式和开放式答案的灵活预测。现有方法在需要读取并理解图像中文本以回答问题的情形下常常失效。实际上,由于视觉特征并非面向文本,它们无法有效处理由文本词元派生的答案序列。为解决上述问题,我们提出了文本感知双路由网络(TDR),其同时处理输入图像中需要和理解不需要理解文本信息的 VQA 情形。具体而言,我们构建了一个双分支答案预测网络,每种情形对应一个特定分支,并进一步开发了双路由方案以动态决定应选择哪个分支。在涉及文本理解的分支中,我们将光学字符识别(OCR)特征融入模型以帮助理解图像中的文本。在 VQA v2.0 数据集上的大量实验表明,我们提出的 TDR 优于现有方法,尤其在“数字”相关的 VQA 问题上。

关键词

引用

@article{arxiv.2211.14450,
  title  = {Text-Aware Dual Routing Network for Visual Question Answering},
  author = {Luoqian Jiang and Yifan He and Jian Chen},
  journal= {arXiv preprint arXiv:2211.14450},
  year   = {2022}
}