中文

面向标志导向的视觉问答:ViSignVQA 数据集、方法与基准

计算机视觉与模式识别 2025-12-30 v1 多媒体

摘要

理解自然场景中的标志文本是视觉问答(VQA)在实际应用中不可或缺的任务,但尤其是在低资源语言中仍未得到充分探索。我们引入 ViSignVQA,第一个面向越南语的大规模数据集,用于标志导向的 VQA,包含 10,762 张图片和 25,573 个问答对。该数据集捕捉了越南语标志的多样化语言、文化和视觉特征,包括双语文本、非正式措辞以及视觉元素如颜色和布局。为对标该任务,我们改编了最新的 VQA 模型(如 BLIP-2、LaTr、PreSTU 和 SaL),集成越南语 OCR 模型(SwinTextSpotter)和越南语预训练语言模型(ViT5)。实验结果突显了 OCR 增强上下文的重要作用,在将 OCR 文本附加到问题后,F1 分数提升了最高可达 209%。此外,我们提出了一个多智能体 VQA 框架,结合感知与推理智能体与 GPT-4,通过多数投票实现 75.98% 的准确率。本研究首次提出大规模多模态数据集用于越南语标志理解。这凸显了在低资源语言中,针对性资源在提升基于文本的 VQA方面的重要性。ViSignVQA 作为基准,捕捉了真实场景文本特征,支持开发和评估集成 OCR 的越南语 VQA 模型。

关键词

引用

@article{arxiv.2512.22218,
  title  = {Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark},
  author = {Hieu Minh Nguyen and Tam Le-Thanh Dang and Kiet Van Nguyen},
  journal= {arXiv preprint arXiv:2512.22218},
  year   = {2025}
}

备注

Dataset paper; code and data will be released