中文

视觉-语言Transformer是否展现出视觉常识?对VCR的实证研究

计算机视觉与模式识别 2024-05-28 v1

摘要

视觉常识推理(VCR)要求对视觉场景中的问答进行解释性推理。为了实现这一目标,模型需要为预测的答案提供可接受的依据作为理由。基准数据集上的进展很大程度上源于视觉-语言Transformer(VL Transformer)的最新进展。这些模型首先在一些通用的大规模视觉-文本数据集上进行预训练,然后将学习到的表示迁移到下游的VCR任务。尽管其性能诱人,但本文认为VL Transformer并未展现出视觉常识,而视觉常识正是VCR的关键。具体而言,我们的实证结果指出了现有VL Transformer的几个缺点:预训练带来的收益小、意外的语言偏差、针对两个不可分子任务的有限模型架构,以及忽略了重要的对象-标签相关性。基于这些发现,我们从数据集、评估指标和训练技巧方面尝试性地提出了一些未来方向。我们相信这项工作能让研究人员重新审视VCR的直觉和目标,从而帮助应对视觉推理中剩余的挑战。

关键词

引用

@article{arxiv.2405.16934,
  title  = {Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR},
  author = {Zhenyang Li and Yangyang Guo and Kejie Wang and Xiaolin Chen and Liqiang Nie and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2405.16934},
  year   = {2024}
}