中文

ViOCRVQA:面向越南文图像的视觉问答新基准数据集与视觉阅读器

计算机视觉与模式识别 2024-04-30 v1

摘要

光学字符识别 - 视觉问答 (OCR-VQA) 是指从图像中获取文本信息的任务,近年来在英语语言上取得了显著发展。然而,针对低资源语言如越南语的此类任务的研究仍寥寥。为此,我们引入了新型数据集 ViOCRVQA(越南语光学字符识别 - 视觉问答数据集),包含 28,000 多张图片和 120,000 多组问答对。该数据集中所有图片均包含文本,且问题围绕图像中文本信息展开。我们借鉴英语语言数据集上最新方法的思路,对该数据集进行实验,揭示了越南语数据集固有的挑战与难点。此外,我们提出了一种新方法,称为 VisionReader,在测试集上实现了 0.4116 的 EM 分数和 0.6990 的 F1 分数。通过结果我们发现,OCR 系统在 ViOCRVQA 数据集上的 VQA 模型中发挥着至关重要的作用。同时,图像中的物体也能提升模型性能。我们将数据集开放访问链接 (https://github.com/qhnhynmm/ViOCRVQA.git) 以便进一步开展越南语 OCR-VQA 任务的研究。

关键词

引用

@article{arxiv.2404.18397,
  title  = {ViOCRVQA: Novel Benchmark Dataset and Vision Reader for Visual Question Answering by Understanding Vietnamese Text in Images},
  author = {Huy Quang Pham and Thang Kien-Bao Nguyen and Quan Van Nguyen and Dan Quang Tran and Nghia Hieu Nguyen and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2404.18397},
  year   = {2024}
}