中文

跨语言与跨文化的视觉接地推理

计算与语言 2021-10-25 v2 人工智能 计算机视觉与模式识别

摘要

广泛使用的视觉-语言数据集与预训练编码器的设计直接采用或借鉴了 ImageNet 的概念与图像。尽管这一基准对计算机视觉进步的贡献怎样高估都不为过,但它主要源自英语的词汇数据库与图像查询,导致源材料带有北美或西欧偏见。因此,我们设计了一种新协议,以构建代表更多语言与文化的 ImageNet 风格层级体系。具体而言,我们让概念与图像的选择完全由母语者驱动,而非自动抓取。我们特别关注一组类型学多样的语言,即印尼语、汉语普通话、斯瓦希里语、泰米尔语和土耳其语。基于通过此新协议获得的概念与图像,我们通过让母语标注者针对图像对给出陈述,创建了用于视觉与语言多文化推理(MaRVL)的多语言数据集。该任务在于判别每个接地陈述为真或假。我们使用最先进模型建立了一系列基线,发现其跨语言迁移性能远远落后于英语中的有监督性能。这些结果促使我们重新评估当前最先进模型在狭窄领域之外的鲁棒性与准确性,同时也为真正多语言与多文化系统的开发开启了令人振奋的新挑战。

关键词

引用

@article{arxiv.2109.13238,
  title  = {Visually Grounded Reasoning across Languages and Cultures},
  author = {Fangyu Liu and Emanuele Bugliarello and Edoardo Maria Ponti and Siva Reddy and Nigel Collier and Desmond Elliott},
  journal= {arXiv preprint arXiv:2109.13238},
  year   = {2021}
}

备注

EMNLP 2021; Fangyu and Emanuele contributed equally; MaRVL website: https://marvl-challenge.github.io