WIT:基于维基百科的图像文本数据集用于多模态多语言机器学习
计算机视觉与模式识别
2023-02-21 v2 计算与语言
信息检索
摘要
深度表示学习与预训练技术带来的里程碑式改进,使得下游 NLP、IR 与视觉任务获得了巨大的性能提升。多模态建模技术旨在利用大规模高质量视觉-语言数据集来学习(跨图像与文本模态的)互补信息。在本文中,我们介绍基于维基百科的图像文本(WIT)数据集(https://github.com/google-research-datasets/wit),以更好地促进多模态、多语言学习。WIT 由一组精心筛选的 3760 万富含实体的图像-文本样例组成,涵盖 108 种维基百科语言中的 1150 万张唯一图像。其规模使得 WIT 可用作多模态模型的预训练数据集,正如我们应用于图像-文本检索等下游任务时所展示的那样。WIT 具有四个主要且独特的优势。首先,按图像-文本样例数量计,WIT 是最大的多模态数据集,达 3 倍(在撰写时)。其次,WIT 是大规模多语言的(同类首创),覆盖 100 多种语言(每种至少 12K 样例)并为许多图像提供跨语言文本。第三,相较于先前数据集所覆盖的内容,WIT 代表了更多样化的概念与真实世界实体。最后,WIT 提供了一个非常具有挑战性的真实世界测试集,我们借助图像-文本检索任务作为示例进行了实证说明。
引用
@article{arxiv.2103.01913,
title = {WIT: Wikipedia-based Image Text Dataset for Multimodal Multilingual Machine Learning},
author = {Krishna Srinivasan and Karthik Raman and Jiecao Chen and Michael Bendersky and Marc Najork},
journal= {arXiv preprint arXiv:2103.01913},
year = {2023}
}