中文

BARTPhoBEiT:面向越南语视觉问答的预训练序列到序列与图像 Transformer 模型

计算与语言 2023-07-31 v1 计算机视觉与模式识别

摘要

视觉问答(VQA)是一项融合自然语言处理(NLP)与计算机视觉(CV)的复杂且高要求的任务,引起了研究者的兴趣。英语因其丰富的资源,在面向 VQA 的数据集与模型方面取得了显著进展。然而,目前缺乏针对越南等特定国家的模型。为弥补这一不足,我们引入了一个基于 Transformer 的越南语模型 BARTPhoBEiT。该模型包含越南语的预训练序列到序列模型与来自图像 Transformer 的双向编码器表示,并在越南语 VQA 数据集上进行了评测。实验结果表明,我们提出的模型优于强基线,并在六项指标上提升了当前最优水平:准确率、精确率、召回率、F1 分数、WUPS 0.0 与 WUPS 0.9。

关键词

引用

@article{arxiv.2307.15335,
  title  = {BARTPhoBEiT: Pre-trained Sequence-to-Sequence and Image Transformers Models for Vietnamese Visual Question Answering},
  author = {Khiem Vinh Tran and Kiet Van Nguyen and Ngan Luu Thuy Nguyen},
  journal= {arXiv preprint arXiv:2307.15335},
  year   = {2023}
}