中文

视觉问答中类人注意力的多模态融合

计算机视觉与模式识别 2026-03-04 v1 计算与语言

摘要

将类人注意力作为监督信号引导神经注意力已显示出显著前景,但目前仅限于单模态融合——即便对于视觉问答(VQA)这类固有的多模态任务也是如此。我们提出多模态类人注意力网络(MULAN)——首个在 VQA 模型训练期间对图像和文本上的类人注意力进行多模态融合的方法。MULAN 将两个最先进的文本和图像显著性模型的注意力预测整合进近期基于 transformer 的 VQA 模型的神经自注意力层中。通过在具挑战性的 VQAv2 数据集上的评估,我们展示 MULAN 在 test-std 上达到了 73.98% 准确率、在 test-dev 上达到 73.72% 的新最优性能,同时可训练参数比先前工作少约 80%。总体而言,我们的工作凸显了为 VQA 融合多模态类人注意力与神经注意力的潜力。

关键词

引用

@article{arxiv.2109.13139,
  title  = {Multimodal Integration of Human-Like Attention in Visual Question Answering},
  author = {Ekta Sood and Fabian Kögel and Philipp Müller and Dominike Thomas and Mihai Bace and Andreas Bulling},
  journal= {arXiv preprint arXiv:2109.13139},
  year   = {2026}
}