迈向鲁棒视觉问答:通过对比学习充分利用有偏样本
计算机视觉与模式识别
2022-10-11 v1 人工智能
摘要
视觉问答(VQA)模型常依赖于训练集有偏样本中出现的虚假相关,即语言先验,这使其在面对分布外(OOD)测试数据时十分脆弱。近期方法通过降低有偏样本对模型训练的影响,在克服该问题上取得了可喜进展。然而,这些模型暴露出一种权衡:在 OOD 数据上的提升严重牺牲了分布内(ID)数据(由有偏样本主导)上的性能。因此,我们提出一种新颖的对比学习方法 MMBS,通过充分利用有偏样本(Making the Most of Biased Samples)来构建鲁棒 VQA 模型。具体而言,我们通过从原始训练样本中消除与虚假相关相关的信息来构造对比学习的正样本,并探索了若干使用该构造正样本进行训练的策略。我们的方法并非削弱有偏样本在模型训练中的重要性,而是精准地利用有偏样本中对推理有用的无偏信息。所提方法与多种 VQA 骨干网络兼容。我们在 OOD 数据集 VQA-CP v2 上取得了具竞争力的性能,同时在 ID 数据集 VQA v2 上保持了鲁棒性能,从而验证了我们的贡献。
引用
@article{arxiv.2210.04563,
title = {Towards Robust Visual Question Answering: Making the Most of Biased Samples via Contrastive Learning},
author = {Qingyi Si and Yuanxin Liu and Fandong Meng and Zheng Lin and Peng Fu and Yanan Cao and Weiping Wang and Jie Zhou},
journal= {arXiv preprint arXiv:2210.04563},
year = {2022}
}
备注
Findings of EMNLP-2022