看、读与问:通过阅读图像中的文本学习提问
计算机视觉与模式识别
2022-11-24 v1
摘要
我们提出一个新问题,即基于文本的视觉问题生成(简称TextVQG)。鉴于文档图像分析领域近期对将文本理解与对话式人工智能(如基于文本的视觉问答)相结合的日益关注,TextVQG成为一项重要任务。TextVQG旨在为给定输入图像及从中自动提取的文本(亦称OCR token)生成自然语言问题,使得该OCR token为所生成问题的答案。TextVQG是对话智能体的一项基本能力。然而其具有挑战性,因为需要对场景的深入理解以及将视觉内容与该图像中文本在语义上桥接的能力。为应对TextVQG,我们提出一种OCR一致的视觉问题生成模型,其观察视觉内容、读取场景文本并提问相关且有意义的自然语言问题。我们将所提模型称为OLRA。我们在两个公开基准上对OLRA进行了广泛评估,并与基线方法比较。我们的模型OLRA自动生成的问题类似于人工整理的公开基于文本的视觉问答数据集中的问题。此外,在文本生成文献常用性能指标上,我们显著优于基线方法。
引用
@article{arxiv.2211.12950,
title = {Look, Read and Ask: Learning to Ask Questions by Reading Text in Images},
author = {Soumya Jahagirdar and Shankar Gangisetty and Anand Mishra},
journal= {arXiv preprint arXiv:2211.12950},
year = {2022}
}