EKTVQA:泛化利用外部知识以增强Text-VQA中的场景文本
计算机视觉与模式识别
2022-07-18 v8 多媒体
摘要
Text-VQA的开放式问答任务常需读取并推理图像中极少出现或完全未见的场景文本内容。我们针对该问题的零样本特性,提出泛化利用外部知识以增强对场景文本的理解。我们设计了一个框架,利用标准的多模态transformer提取、验证并推理知识,用于视觉语言理解任务。通过实证与定性结果,我们展示了外部知识如何凸显仅实例线索,从而帮助应对训练数据偏差、提升答案实体类型正确性并检测多词命名实体。在相似上游OCR系统与训练数据的约束下,我们在三个公开数据集上取得了与当前最优(SOTA)相当的结果。
引用
@article{arxiv.2108.09717,
title = {EKTVQA: Generalized use of External Knowledge to empower Scene Text in Text-VQA},
author = {Arka Ujjal Dey and Ernest Valveny and Gaurav Harit},
journal= {arXiv preprint arXiv:2108.09717},
year = {2022}
}
备注
Accepted at IEEE Access