中文

ViTextVQA:大规模越南语视觉问答数据集与用于越南语文本理解的新型多模态特征融合方法

计算与语言 2026-02-24 v5

摘要

视觉问答(VQA)是一种需要自然语言和视觉内容联合理解的挑战性任务。虽然早期研究主要关注识别对象和场景上下文,却往往忽视了场景文本——这是来自显式语义信息的重要来源。本文引入ViTextVQA(越南语文本-based视觉问答),这是第一个专注于文本-based VQA的大规模越南语数据集。数据集包含超过16,000张图片和超过50,000个问题-答案对。为高效解决此任务,提出了ViTextBLIP-2(越南语文本-based通过微调的Bootstrapped Language-Image Model),这是一种 novel multimodal feature fusion方法,旨在优化越南语文本-based VQA。在使用 state-of-the-art模型进行实验后,我们突出了OCR文本中token排序对答案生成的重要性,从而实现显著的性能提升。ViTextVQA数据集将向研究界公开提供。

关键词

引用

@article{arxiv.2404.10652,
  title  = {ViTextVQA: A Large-Scale Visual Question Answering Dataset and a Novel Multimodal Feature Fusion Method for Vietnamese Text Comprehension in Images},
  author = {Quan Van Nguyen and Dan Quang Tran and Huy Quang Pham and Thang Kien-Bao Nguyen and Nghia Hieu Nguyen and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2404.10652},
  year   = {2026}
}

备注

International Journal of Expert Systems with Applications