中文

LiGT:面向越南发票的布局感知生成变换器用于视觉问答

计算与语言 2025-03-10 v2

摘要

文档视觉问答(Document VQA)挑战多模态系统在处理文本、布局和视觉三种模态以提供恰当答案方面的综合能力。近年来,随着文档数量的增加以及对数字化的高需求,文档VQA受到了广泛关注。然而,大多数文档VQA数据集是在高资源语言(如英语)中开发的。本文提出ReceiptVQA(发票视觉问答),这是最初的大规模越南语言文档VQA数据集,专注于发票,这是一种具有高商业潜力的文档类型。该数据集包含9000+张发票图像和60000+个手动标注的问答对。除本研究外,我们还引入LiGT(布局感知生成变换器),一种布局感知编码器-解码器架构,旨在利用语言模型的嵌入层操作布局嵌入,最小化额外神经模块的使用。在ReceiptVQA上的实验表明,我们的架构取得了有希望的性能,相对于优秀的基线方法实现了竞争性的结果。此外,通过分析实验结果,我们发现采用仅编码器模型架构相对于能够生成答案的架构存在显显著的劣势。我们还观察到,尽管语言模型在语义理解方面发挥关键作用,但仍需结合多种模态来解决本数据集。我们希望我们的工作将鼓励并促进越南语言文档VQA领域的未来发展,为多样化的多模态研究社区做出贡献。

关键词

引用

@article{arxiv.2502.19202,
  title  = {LiGT: Layout-infused Generative Transformer for Visual Question Answering on Vietnamese Receipts},
  author = {Thanh-Phong Le and Trung Le Chi Phan and Nghia Hieu Nguyen and Kiet Van Nguyen},
  journal= {arXiv preprint arXiv:2502.19202},
  year   = {2025}
}

备注

Accepted at IJDAR