融合Transformer与卷积网络的越南语视觉问答方法
计算机视觉与模式识别
2024-08-01 v1 计算与语言
摘要
视觉问答(VQA)近期作为一个潜在的研究领域出现,吸引了人工智能和计算机视觉领域众多研究者的兴趣。尽管英语方法已广泛存在,但针对特定语言(尤其是越南语)的系统仍显著缺乏。本研究旨在通过针对越南语视觉问答(ViVQA)数据集进行全面实验来填补这一空白,展示所提出模型的有效性。为回应社区需求,我们开发了一种模型以增强图像表征能力,从而提升 ViVQA 系统的整体性能。具体而言,我们的模型融合了引导语言-图像预训练与冻结单模态模型(BLIP-2)以及卷积神经网络 EfficientNet,以提取和处理图像中的局部和全局特征。该融合充分利用了基于 Transformer 的架构在捕获全面上下文信息方面的优势以及卷积网络在提取详细局部特征方面的优势。通过冻结这些预训练模型的参数,我们显著降低了计算成本和训练时间,同时保持了高性能。这种方法显著改善了图像表征并提升了现有 VQA 系统的性能。随后,我们利用基于通用多模态基础模型(BEiT-3)的多模态融合模块来融合视觉和文本特征。实验结果表明我们的模型超越了竞争性基线,在 ViVQA 数据集测试集上取得了 71.04% 的准确率,标志着我们研究领域的重要进展。代码地址:https://github.com/nngocson2002/ViVQA。
引用
@article{arxiv.2407.21229,
title = {Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration},
author = {Ngoc Son Nguyen and Van Son Nguyen and Tung Le},
journal= {arXiv preprint arXiv:2407.21229},
year = {2024}
}
备注
Accepted at the journal of Computers & Electrical Engineering (Received 8 March 2024, Revised 8 June 2024, Accepted 10 July 2024)