中文

融合图像特征与卷积序列到序列网络的多语言视觉问答

计算机视觉与模式识别 2024-06-18 v2 计算与语言

摘要

视觉问答(VQA)是一项要求计算机基于图像对输入问题给出正确回答的任务。该任务人类可轻松解决,但对计算机而言具有挑战性。VLSP2022-EVJVQA 共享任务在一个新发布的数据集 UIT-EVJVQA 上开展了多语言领域的视觉问答任务,其中问题和答案以三种不同语言书写:英语、越南语和日语。我们将该挑战作为序列到序列学习任务来处理,其中我们将来自预训练最先进 VQA 模型的提示以及图像特征与卷积序列到序列网络相融合以生成所需答案。我们的结果在公开测试集上 F1 分数达到 0.3442,在私有测试集上达到 0.4210,并在竞赛中名列第 3。

关键词

引用

@article{arxiv.2303.12671,
  title  = {Integrating Image Features with Convolutional Sequence-to-sequence Network for Multilingual Visual Question Answering},
  author = {Triet Minh Thai and Son T. Luu},
  journal= {arXiv preprint arXiv:2303.12671},
  year   = {2024}
}

备注

VLSP2022-EVJVQA