基于推理监督的可解释视觉问答
计算机视觉与模式识别
2023-09-08 v1
摘要
基于Transformer的架构近期在视觉问答(VQA)任务中展现出卓越性能。然而,此类模型可能忽略关键视觉线索,并常依赖多模态捷径与语言模态固有偏置来预测正确答案,该现象通常被称为缺乏视觉接地。本工作中,我们通过一种新颖的视觉问答架构缓解此缺陷,该架构利用常识推理作为监督信号。推理监督采取正确答案的文本论证形式,此类标注在大规模视觉常识推理(VCR)数据集上已可用。模型的视觉注意力通过相似度损失导向场景重要元素,该损失对齐由问题与正确推理引导的所学注意力分布。我们从定量与定性上证明,所提方法可提升模型视觉感知能力并带来性能增益,且无需在显式接地标注上训练。
引用
@article{arxiv.2309.03726,
title = {Interpretable Visual Question Answering via Reasoning Supervision},
author = {Maria Parelli and Dimitrios Mallis and Markos Diomataris and Vassilis Pitsikalis},
journal= {arXiv preprint arXiv:2309.03726},
year = {2023}
}