中文

面向鲁棒视觉问答的生成式偏置方法

计算机视觉与模式识别 2023-03-23 v3 人工智能 计算与语言 机器学习

摘要

视觉问答(VQA)任务已知深受 VQA 模型利用数据集内偏置进行最终预测的问题困扰。先前已提出多种基于集成的去偏方法,其中额外训练一个模型以故意产生偏置,从而训练鲁棒的目标模型。然而,这些方法仅从训练数据的标签统计或单模态分支简单地计算模型偏置。在本工作中,为了更好地学习目标 VQA 模型所遭受的偏置,我们提出一种直接从目标模型训练偏置模型的生成式方法,称为 GenB。具体而言,GenB 采用生成网络,通过对抗目标和知识蒸馏的组合来学习目标模型中的偏置。随后我们以 GenB 作为偏置模型对目标模型去偏,并通过大量实验展示了我们的方法在包括 VQA-CP2、VQA-CP1、GQA-OOD 和 VQA-CE 在内的多个 VQA 偏置数据集上的效果,并在 VQA-CP2 上以 LXMERT 架构展示了最先进的结果。

关键词

引用

@article{arxiv.2208.00690,
  title  = {Generative Bias for Robust Visual Question Answering},
  author = {Jae Won Cho and Dong-jin Kim and Hyeonggon Ryu and In So Kweon},
  journal= {arXiv preprint arXiv:2208.00690},
  year   = {2023}
}

备注

CVPR 2023