中文

基于多数据集与多方法但无目标标签的域鲁棒视觉问答

计算机视觉与模式识别 2021-03-31 v1

摘要

计算机视觉方法会过拟合到数据集特性这一现象,启发了多种使目标识别模型对域偏移鲁棒的探索。然而,针对域鲁棒视觉问答(VQA)方法的类似工作非常有限。VQA的域适应不同于目标识别的域适应,因其具有额外复杂性:VQA模型处理多模态输入,方法包含多个步骤与不同模块从而导致复杂优化,且不同数据集的答案为空间差异巨大。为应对这些挑战,我们首先在视觉与文本空间中量化了流行VQA数据集之间的域偏移。为解耦由不同模态引发的数据集间偏移,我们还分别构建了图像域与问题域中的合成偏移。其次,我们测试了不同系列VQA方法(经典双流、transformer与神经符号方法)对这些偏移的鲁棒性。第三,我们测试了现有域适应方法的适用性,并设计了一种新的方法以弥合VQA域差距,该方法针对特定VQA模型进行调整。为模拟真实世界泛化设定,我们聚焦于无监督域适应与开放式分类任务形式。

关键词

引用

@article{arxiv.2103.15974,
  title  = {Domain-robust VQA with diverse datasets and methods but no target labels},
  author = {Mingda Zhang and Tristan Maidment and Ahmad Diab and Adriana Kovashka and Rebecca Hwa},
  journal= {arXiv preprint arXiv:2103.15974},
  year   = {2021}
}

备注

To appear in CVPR 2021