面向视觉问答的基于语言偏置学习内容与上下文的方法
计算机视觉与模式识别
2020-12-22 v1
摘要
视觉问答(VQA)是一项关于回答图像相关问题的具有挑战性的多模态任务。许多工作集中于如何减少语言偏置,该偏置使模型忽略视觉内容与语言上下文来回答问题。然而,减少语言偏置也削弱了VQA模型学习上下文先验的能力。为解决此问题,我们提出一种名为 CCB 的新型学习策略,其迫使VQA模型依赖内容与上下文并兼顾语言偏置来回答问题。具体而言,CCB在基础VQA模型之上建立内容与上下文分支,并分别迫使它们关注局部关键内容与全局有效上下文。此外,提出一种联合损失函数以降低偏置样本的重要性,同时保留其对回答问题的有益影响。实验表明,CCB 在 VQA-CP v2 上的准确率优于最先进的方法。
引用
@article{arxiv.2012.11134,
title = {Learning content and context with language bias for Visual Question Answering},
author = {Chao Yang and Su Feng and Dongsheng Li and Huawei Shen and Guoqing Wang and Bin Jiang},
journal= {arXiv preprint arXiv:2012.11134},
year = {2020}
}