AutoViVQA:一个大规模自动构建的越南语视觉问答数据集
计算机视觉与模式识别
2026-03-12 v2 人工智能
摘要
视觉问答(VQA)是一种需要模型同时理解视觉和文本信息的基本多模态任务。早期的 VQA 系统高度依赖语言偏见,这促使后续工作强调视觉 grounding 和平衡数据集。随着大规模预训练 transformer 在文本和视觉领域取得成功——例如 PhoBERT 用于越南语语言理解以及 Vision Transformers(ViT)用于图像表示学习——多模态融合取得了显著进展。对于越南语 VQA,已引入多个数据集以促进低资源多模态学习研究,包括 ViVQA、OpenViVQA 以及最近提出的 ViTextVQA。这些资源 enable 对在越南语语境中整合语言和视觉特征的模型进行基准测试。VQA 系统的评估常采用最初为图像描述或机器翻译设计的自动指标,如 BLEU、METEOR、CIDEr、Recall、Precision 和 F1 分数。然而,近期研究表明,大型语言模型可以进一步 improve VQA 任务中自动评估与人类判断之间的 alignment。在本工作中,我们探索了基于 transformer 的越南语视觉问答,利用文本和视觉预训练,系统性地比较了在多语言环境下自动评估指标的表现。
引用
@article{arxiv.2603.09689,
title = {AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering},
author = {Nguyen Anh Tuong and Phan Ba Duc and Nguyen Trung Quoc and Tran Dac Thinh and Dang Duy Lan and Nguyen Quoc Thinh and Tung Le},
journal= {arXiv preprint arXiv:2603.09689},
year = {2026}
}