中文

面向鲁棒视觉问答的贪心梯度集成方法

计算机视觉与模式识别 2021-08-24 v4 计算与语言 机器学习

摘要

语言偏置是视觉问答(VQA)中的一个关键问题,模型常利用数据集偏置进行最终决策而不考虑图像信息,导致其在分布外数据上性能下降且视觉解释不足。基于对有界鲁棒 VQA 方法的实验分析,我们强调 VQA 中的语言偏置来自两方面,即分布偏置与捷径偏置。我们进一步提出一种新的去偏框架——贪心梯度集成(GGE),其结合多个有偏模型以学习无偏基模型。通过贪心策略,GGE 强制有偏模型优先过拟合偏置数据分布,从而使基模型更关注那些难以被有偏模型解决的样本。实验表明,我们的方法更好地利用了视觉信息,并在诊断数据集 VQA-CP 上取得了最优性能,且无需使用额外标注。

关键词

引用

@article{arxiv.2107.12651,
  title  = {Greedy Gradient Ensemble for Robust Visual Question Answering},
  author = {Xinzhe Han and Shuhui Wang and Chi Su and Qingming Huang and Qi Tian},
  journal= {arXiv preprint arXiv:2107.12651},
  year   = {2021}
}

备注

Accepted by ICCV 2021. Code: https://github.com/GeraldHan/GGE