中文

拓宽视野:地理多样性视觉常识推理

计算与语言 2021-09-15 v1 人工智能 计算机视觉与模式识别

摘要

常识被定义为人人共享的知识。然而,某些类型的常识知识与文化和地理位置相关,仅在局部共享。例如,受历史与宗教因素影响的习俗差异导致婚礼场景因地区而异。此类区域特征在既往工作中通常被忽略。本文构建了一个地理多样性视觉常识推理数据集(GD-VCR),以测试视觉-语言模型理解文化与地理区位特定常识的能力。我们特别研究了两个最先进的视觉-语言模型,即在 VCR(一个以西方地区图像为主的标准多模态常识基准)上训练的 VisualBERT 与 ViLBERT。随后我们评估训练好的模型在回答 GD-VCR 中问题的泛化能力。我们发现,对于包括东亚、南亚和非洲在内的非西方地区,两个模型的性能显著低于西方地区。我们分析了性能差异背后的原因,发现差距在以下 QA 对上更大:1)涉及文化相关场景,如婚礼、宗教活动与节日;2)需要高阶地理多样性常识推理而非低阶感知与识别。数据集与代码发布于 https://github.com/WadeYin9712/GD-VCR。

关键词

引用

@article{arxiv.2109.06860,
  title  = {Broaden the Vision: Geo-Diverse Visual Commonsense Reasoning},
  author = {Da Yin and Liunian Harold Li and Ziniu Hu and Nanyun Peng and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2109.06860},
  year   = {2021}
}

备注

EMNLP 2021. Code and data are available at https://github.com/WadeYin9712/GD-VCR