中文

ViConsFormer:基于Transformer的方法用于越南语文本视觉问答中的构成有意义短语

计算机视觉与模式识别 2024-10-25 v2 计算与语言

摘要

文本基于视觉问答是一个具有挑战性的任务,需要机器从给定图像中的场景文本中提取信息,以为给定问题生成最合适的答案。文本基于视觉问答的主要挑战在于从场景文本中挖掘意义和信息。最近的研究通过考虑场景文本在图像中的空间信息,通过对其边界框的二维坐标进行嵌入来解决这一挑战。在本研究中,我们遵循语言学中对意义的定义,提出了一种新方法,有效地利用了用越南语书写的场景文本的信息。实验结果表明,我们提出的方法在两个大规模越南语文本视觉问答数据集上取得了最先进的结果。该实现的链接如下。

关键词

引用

@article{arxiv.2410.14132,
  title  = {ViConsFormer: Constituting Meaningful Phrases of Scene Texts using Transformer-based Method in Vietnamese Text-based Visual Question Answering},
  author = {Nghia Hieu Nguyen and Tho Thanh Quan and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2410.14132},
  year   = {2024}
}

备注

PACLIC 2024