中文

ViCLEVR:面向越南语视觉问答的视觉推理数据集与混合多模态融合模型

计算与语言 2023-10-30 v1 计算机视觉与模式识别

摘要

近年来,视觉问答(VQA)因其在智能车载辅助、帮助视障人士以及利用自然语言查询进行文档图像信息检索等多样应用而备受关注。VQA需要有效整合来自问题和图像的信息以生成准确答案。基于神经网络的VQA模型在大规模数据集上取得了显著进展,主要集中于英语等资源丰富语言。为此,我们引入ViCLEVR数据集,这是首个用于评估越南语各种视觉推理能力并减轻偏差的数据集。该数据集包含超过26000张图像和30000个问答对(QAs),每个问题均标注了所涉及的推理类型。利用该数据集,我们对当代视觉推理系统进行了全面分析,提供了关于其优势与局限性的宝贵见解。此外,我们提出PhoVIT,一种基于问题识别图像中物体的全面多模态融合模型。该架构有效运用transformers实现对文本与视觉数据的同步推理,并在模型早期阶段融合两种模态。实验结果表明,我们所提模型在四项评估指标上达到了最先进性能。相关代码与数据集已公开于 \url{https://github.com/kvt0012/ViCLEVR}。此举旨在促进研究社区的进展,推动更多专门针对低资源语言(以越南语为例)细微特征的多模态融合算法开发。

关键词

引用

@article{arxiv.2310.18046,
  title  = {ViCLEVR: A Visual Reasoning Dataset and Hybrid Multimodal Fusion Model for Visual Question Answering in Vietnamese},
  author = {Khiem Vinh Tran and Hao Phu Phan and Kiet Van Nguyen and Ngan Luu Thuy Nguyen},
  journal= {arXiv preprint arXiv:2310.18046},
  year   = {2023}
}

备注

A pre-print version and submitted to journal