一幅图之于视觉问答或值百言
计算机视觉与模式识别
2021-06-28 v1
摘要
在理解图像方面,文本表示能走多远?在图像理解中,使用简洁而详尽的图像表示至关重要。由视觉模型(如Faster R-CNN)提取的深度视觉特征在多项任务中普遍使用,尤其在视觉问答(VQA)中。然而,常规深度视觉特征可能难以像人类那样传达图像中的所有细节。同时,随着近期语言模型的进展,描述性文本或可作为该问题的替代方案。本文深入探究了在VQA这一具体情境下文本表示用于图像理解的有效性。我们提出以描述-问题对而非深度视觉特征作为输入,并将其送入仅含语言的Transformer模型,从而简化流程与计算开销。我们还尝试了数据增强技术,以增加训练集多样性并避免学习统计偏差。大量评估表明,在VQA 2.0与VQA-CP v2上,文本表示仅需约百词即可与深度视觉特征相媲美。
引用
@article{arxiv.2106.13445,
title = {A Picture May Be Worth a Hundred Words for Visual Question Answering},
author = {Yusuke Hirota and Noa Garcia and Mayu Otani and Chenhui Chu and Yuta Nakashima and Ittetsu Taniguchi and Takao Onoye},
journal= {arXiv preprint arXiv:2106.13445},
year = {2021}
}