中文

语言先验并非唯一捷径:一个用于 VQA 中捷径学习的基准

计算机视觉与模式识别 2022-10-11 v1

摘要

视觉问答(VQA)模型易于学习由数据集偏差形成的捷径解,而非预期的求解方式。为评估 VQA 模型超越捷径学习的推理能力,VQA-CP v2 数据集在给定问题类型下引入了训练集与测试集之间的分布偏移。如此一来,模型便无法利用训练集捷径(从问题类型到答案)在测试集上取得良好表现。然而,VQA-CP v2 仅考虑了一种捷径类型,因而仍无法保证模型依赖的是预期解而非针对该捷径特有的解。为克服此局限,我们提出一个新数据集,通过在多个分布外(OOD)测试集中构建不同的分布偏移来考虑多样的捷径类型。此外,我们克服了 VQA-CP v2 使用中的三种棘手做法(例如使用 OOD 测试集选取模型),并进一步规范了 OOD 评估流程。我们的基准为 VQA 中的捷径学习提供了更严谨且全面的测试平台。我们对近期方法进行了基准测试,发现专为特定捷径设计的方法无法同时泛化到我们多样的 OOD 测试集。我们还系统性地研究了各类捷径并给出了若干有价值的发现,或可促进 VQA 中捷径学习的探索。

关键词

引用

@article{arxiv.2210.04692,
  title  = {Language Prior Is Not the Only Shortcut: A Benchmark for Shortcut Learning in VQA},
  author = {Qingyi Si and Fandong Meng and Mingyu Zheng and Zheng Lin and Yuanxin Liu and Peng Fu and Yanan Cao and Weiping Wang and Jie Zhou},
  journal= {arXiv preprint arXiv:2210.04692},
  year   = {2022}
}

备注

Fingdings of EMNLP-2022