中文

基于排序的混合训练与多模态融合增强视觉问答

计算机视觉与模式识别 2024-09-24 v2 计算与语言 机器学习

摘要

视觉问答 (VQA) 是一项具有挑战性的任务,要求系统基于图像内容提供准确的答案。现有的 VQA 模型由于在有效捕捉和整合多模态信息方面存在局限,在处理复杂问题时面临困难。为应对这些挑战,我们提出了 Rank VQA 模型,该模型利用基于排序的混合训练策略来增强 VQA 性能。Rank VQA 模型整合了使用 Faster R-CNN 模型提取的高质量视觉特征以及从预训练 BERT 模型获取的丰富语义文本特征。这些特征通过采用多头自注意力机制的复杂多模态融合技术进行融合。此外,引入了一个排序学习模块来优化答案的相对排名,从而提高答案的准确性。混合训练策略结合了分类损失和排序损失,增强了模型在多样化数据集上的泛化能力和鲁棒性。实验结果证明了 Rank VQA 模型的有效性。我们的模型在标准 VQA 数据集(包括 VQA v2.0 和 COCO-QA)上显著优于现有最先进模型,在准确性和平均倒数排名 (MRR) 方面均表现出色。Rank VQA 的优越性能体现在其处理需要理解细微细节并从图像和文本中进行复杂推理的复杂问题的能力。这项工作强调了基于排序的混合训练策略在提升 VQA 性能方面的有效性,并为多模态学习方法的后续研究奠定了基础。

关键词

引用

@article{arxiv.2408.07303,
  title  = {Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion},
  author = {Peiyuan Chen and Zecheng Zhang and Yiping Dong and Li Zhou and Han Wang},
  journal= {arXiv preprint arXiv:2408.07303},
  year   = {2024}
}

备注

Visual Question Answering, Rank VQA, Faster R-CNN, BERT, Multimodal Fusion, Ranking Learning, Hybrid Training Strategy