VQA-MHUG:用于研究视觉问答中多模态神经注意力的眼动数据集
计算机视觉与模式识别
2026-03-04 v1 计算与语言
摘要
我们提出 VQA-MHUG——一个使用高速眼动仪收集的、由 49 名被试在视觉问答 (VQA) 过程中对图像和问题进行多模态人类注视的新数据集。我们利用该数据集分析五种最先进 VQA 模型所学人类与神经注意力策略之间的相似性:采用网格或区域特征的模块化协同注意力网络 (MCAN)、Pythia、双线性注意力网络 (BAN) 和多模态因子化双线性池化网络 (MFB)。先前工作聚焦于研究图像模态,而我们的分析首次表明——对于所有模型,在文本上与人类注意力更高的相关性是 VQA 性能的显著预测因子。这一发现指向提升 VQA 性能的潜力,同时也呼吁进一步研究神经文本注意力机制及其在视觉与语言任务架构中的集成,包括但可能不限于 VQA。
引用
@article{arxiv.2109.13116,
title = {VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering},
author = {Ekta Sood and Fabian Kögel and Florian Strohm and Prajit Dhar and Andreas Bulling},
journal= {arXiv preprint arXiv:2109.13116},
year = {2026}
}
备注
CoNLL 2021