通过区分表面相似实例克服视觉问答中的语言先验
计算与语言
2022-09-20 v1 计算机视觉与模式识别
多媒体
摘要
尽管视觉问答(VQA)取得巨大进展,当前 VQA 模型严重依赖问题类型与其常见答案之间的表面相关性(即语言先验)进行预测,并未真正理解输入。本工作中,我们将具有相同问题类型但不同答案的训练实例定义为“表面相似实例”,并将语言先验归因于 VQA 模型在此类实例上的混淆。为解决该问题,我们提出一种新颖训练框架,显式鼓励 VQA 模型区分表面相似实例。具体而言,对每个训练实例,我们首先构造一个包含其表面相似对应项的集合。随后我们利用所提区分模块在答案空间中增大该实例与其对应项之间的距离。如此,VQA 模型被迫进一步关注问题类型之外的输入其他部分,有助于克服语言先验。实验结果表明,我们的方法在 VQA-CP v2 上取得最优性能。代码见 \href{https://github.com/wyk-nku/Distinguishing-VQA.git}{Distinguishing-VQA}。
引用
@article{arxiv.2209.08529,
title = {Overcoming Language Priors in Visual Question Answering via Distinguishing Superficially Similar Instances},
author = {Yike Wu and Yu Zhao and Shiwan Zhao and Ying Zhang and Xiaojie Yuan and Guoqing Zhao and Ning Jiang},
journal= {arXiv preprint arXiv:2209.08529},
year = {2022}
}
备注
Published in COLING 2022