中文

视觉问答架构的组件分析

计算机视觉与模式识别 2020-07-30 v2 计算与语言 机器学习

摘要

计算机视觉与自然语言处理领域近期的研究进展引入了若干新任务,为求解 AI 完备问题铺平了道路。其中一项任务称为视觉问答(VQA)。VQA 系统必须接收一张图像和一个关于该图像的自由形式、开放式的自然语言问题,并输出一个自然语言答案。此类任务已引起科学界的极大关注,催生了大量旨在提升 VQA 预测精度的方案。其中多数包含三个主要组件:(i) 图像与问题的独立表示学习;(ii) 特征融合,使模型能利用两种来源的信息来回答视觉问题;(iii) 以自然语言生成正确答案。随着近期大量方案的提出,各组件对模型最终性能的实际贡献变得不明。本文的主要目标是就 VQA 模型中各组件的影响提供一项全面分析。我们广泛的实验涵盖了视觉与文本要素,以及这些表示以融合与注意力机制形式的结合。我们的主要贡献是辨识出训练 VQA 模型以最大化其预测性能的核心组件。

关键词

引用

@article{arxiv.2002.05104,
  title  = {Component Analysis for Visual Question Answering Architectures},
  author = {Camila Kolling and Jônatas Wehrmann and Rodrigo C. Barros},
  journal= {arXiv preprint arXiv:2002.05104},
  year   = {2020}
}