让 Text-VQA 中的 V 真正发挥作用
计算机视觉与模式识别
2023-08-02 v1 人工智能
计算与语言
摘要
基于文本的 VQA 旨在通过阅读图像中出现的文本来回答问题。与 VQA 任务相比,它需要大量的场景-文本关系理解。近期研究表明,数据集中的问答对更关注图像中出现的文本,而较少重视视觉特征,且某些问题不需要理解图像。在该数据集上训练的模型由于缺乏对视觉上下文的理解而预测出有偏答案。例如,在“招牌上写了什么?”这类问题中,模型预测的回答总是“STOP”,这使得模型忽略图像。为解决这些问题,我们提出一种方法,利用 VQA 数据集作为基于文本的 VQA 的外部知识,与 OCR 特征和问题特征一起学习视觉特征(让 V 在 TextVQA 中起作用)。具体而言,我们合并 TextVQA 数据集与 VQA 数据集,并在该合并数据集上训练模型。这种简单而有效的途径增进了对图像特征与图像中文本之间理解和关联,有助于更好地回答问题。我们进一步在不同数据集上测试模型并比较其定性与定量结果。
引用
@article{arxiv.2308.00295,
title = {Making the V in Text-VQA Matter},
author = {Shamanthak Hegde and Soumya Jahagirdar and Shankar Gangisetty},
journal= {arXiv preprint arXiv:2308.00295},
year = {2023}
}
备注
Accepted for the CVPR 2023 Workshop on Open-Domain Reasoning Under Multi-Modal Settings