用于鲁棒视觉问答的反事实样本合成与训练
计算机视觉与模式识别
2023-06-27 v2 人工智能
计算与语言
多媒体
摘要
当今的 VQA 模型仍倾向于捕捉训练集中的表层语言相关性,并无法泛化到具有不同问答分布的测试集。为减少这些语言偏差,近期 VQA 工作引入一个辅助的仅问句模型来正则化目标 VQA 模型的训练,并在分布外诊断基准上取得主导性性能。然而,由于复杂的模型设计,这些基于集成的方法无法具备理想 VQA 模型的两个不可或缺特性:1) 视觉可解释:模型在做决策时应依赖于正确的视觉区域。2) 问题敏感:模型应对问题中的语言变化敏感。为此,我们提出一种新颖的模型无关的反事实样本合成与训练(CSST)策略。经 CSST 训练后,VQA 模型被迫关注所有关键物体与词,显著提升了视觉可解释与问题敏感能力。具体而言,CSST 由两部分组成:反事实样本合成(CSS)与反事实样本训练(CST)。CSS 通过仔细掩蔽图像中的关键物体或问题中的词并赋予伪真值答案来生成反事实样本。CST 不仅用互补样本训练 VQA 模型以预测各自真值答案,还促使 VQA 模型进一步区分原始样本与表层相似的反事实样本。为便利 CST 训练,我们提出 VQA 的两种监督对比损失变体,并基于 CSS 设计有效的正负样本选择机制。大量实验已表明 CSST 的有效性。特别地,在 LMH+SAR 模型之上构建,我们在所有 OOD 基准上取得破纪录性能。
引用
@article{arxiv.2110.01013,
title = {Counterfactual Samples Synthesizing and Training for Robust Visual Question Answering},
author = {Long Chen and Yuhang Zheng and Yulei Niu and Hanwang Zhang and Jun Xiao},
journal= {arXiv preprint arXiv:2110.01013},
year = {2023}
}
备注
IEEE Transactions on Pattern Analysis and Machine Intelligence, TPAMI 2023. (Extension of CVPR'20 work). arXiv admin note: text overlap with arXiv:2003.06576