中文

OpenViVQA:越南语视觉问答的任务、数据集与多模态融合模型

计算与语言 2023-10-03 v1

摘要

近年来,视觉问答(VQA)因其极具潜力的应用(如智能汽车虚拟辅助、盲人辅助设备,或以自然语言为查询的文档图像信息检索)与挑战性而受到研究界关注。VQA 任务要求方法能够融合问题与图像信息以生成恰当答案。神经视觉问答模型在大规模数据集上取得巨大进展,但这些数据集大多面向英语等资源丰富语言。然而,现有数据集将 VQA 任务窄化为答案选择或答案分类任务。我们认为这种 VQA 形式远不及人类能力,且通过仅选择而非生成答案消除了 VQA 任务中回答层面的挑战。本文介绍 OpenViVQA(开放域越南语视觉问答)数据集,这是首个面向越南语、带开放式答案的 VQA 大规模数据集,包含 11,000+ 图像及与之关联的 37,000+ 问答对(QAs)。此外,我们提出 FST、QuMLAG 与 MLPAG,它们融合图像与答案信息,并利用这些融合特征像人类一样迭代式构建答案。所提方法取得与 SAAA、MCAN、LORA、M4C 等 SOTA 模型相当的结果。该数据集已公开,以鼓励研究界开发更通用的算法(包括面向越南语等低资源语言的 transformer)。

关键词

引用

@article{arxiv.2305.04183,
  title  = {OpenViVQA: Task, Dataset, and Multimodal Fusion Models for Visual Question Answering in Vietnamese},
  author = {Nghia Hieu Nguyen and Duong T. D. Vo and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2305.04183},
  year   = {2023}
}

备注

submitted to Elsevier