基于 Barlow 约束优化的视觉问答方法
计算机视觉与模式识别
2022-03-09 v1
摘要
视觉问答是一项视觉与语言的多模态任务,旨在根据问题和图像模态的样本预测答案。近期大多数方法侧重于学习图像与问题的良好联合嵌入空间,要么通过改进这两种模态之间的交互,要么使其成为一个更具判别性的空间。然而,该联合空间的信息量如何,尚未得到充分探索。本文针对 VQA 模型提出了一种新颖的正则化方法——基于 Barlow 理论的约束优化(COB),它通过最小化冗余来提升联合空间的信息内容。该方法降低了所学特征分量之间的相关性,从而解耦语义概念。我们的模型还将联合空间与答案嵌入空间对齐,其中我们将答案与图像+问题视为本质上同一语义信息的两种不同“视图”。我们提出了一种约束优化策略,以平衡分类损失与冗余最小化力量。在 SOTA 的 GGE 模型上构建时,所得模型在 VQA-CP v2 和 VQA v2 数据集上分别将 VQA 准确率提升了 1.4% 和 4%。该模型还展现出更好的可解释性。
引用
@article{arxiv.2203.03727,
title = {Barlow constrained optimization for Visual Question Answering},
author = {Abhishek Jha and Badri N. Patro and Luc Van Gool and Tinne Tuytelaars},
journal= {arXiv preprint arXiv:2203.03727},
year = {2022}
}