物体属性在视觉问答中的重要性
计算机视觉与模式识别
2024-01-19 v1 人工智能
摘要
视觉问答是一项需要联合理解视觉和文本信息的多模态任务。然而,仅通过注意力层整合视觉和文本语义不足以全面理解和对齐来自两种模态的信息。直观上,物体属性可以自然地作为统一它们的桥梁,但这在以往的研究中被忽视了。在本文中,我们从利用物体属性的角度提出了一种新颖的 VQA 方法,旨在实现更好的物体级视觉 - 语言对齐和多模态场景理解。具体而言,我们设计了一个属性融合模块和一个对比知识蒸馏模块。属性融合模块构建了一个多模态图神经网络,通过消息传递融合属性和视觉特征。增强的物体级视觉特征有助于解决计数问题等细粒度问题。更好的物体级视觉 - 语言对齐有助于理解多模态场景,从而提高模型的鲁棒性。此外,为了增强场景理解和分布外性能,对比知识蒸馏模块引入了一系列隐式知识。我们通过对比损失将知识蒸馏到属性中,这进一步加强了属性特征的表示学习并促进了视觉 - 语言对齐。在六个数据集(COCO-QA、VQAv2、VQA-CPv2、VQA-CPv1、VQAvs 和 TDIUC)上的大量实验显示了所提方法的优越性。
引用
@article{arxiv.2401.09442,
title = {Object Attribute Matters in Visual Question Answering},
author = {Peize Li and Qingyi Si and Peng Fu and Zheng Lin and Yan Wang},
journal= {arXiv preprint arXiv:2401.09442},
year = {2024}
}
备注
AAAI 2024