Bloom Library:面向多种下游任务的 300+ 种语言多模态数据集
计算与语言
2022-10-27 v1 人工智能
摘要
我们提出了 Bloom Library,一个语言上多样化的多模态和多语言数据集集合,用于语言建模、图像描述、视觉叙事以及语音合成/识别。对于所包含的每个下游任务,这些数据集要么是语言最多的,要么是语言最多之一的数据集。Bloom Library 数据集的初始版本总共涵盖 32 个语系的 363 种语言。我们针对数据中呈现的各种语言训练了下游任务模型,证明了该数据在未来低资源、多模态 NLP 工作中的可行性,并为某些语言(例如 Bisu [bzi],估计有 700 名使用者)的这些下游任务建立了已知的首批基准。其中一些首创性的基准可与高资源语言的 SOTA 性能相媲美。Bloom Library 数据集在 Hugging Face 数据集中心以知识共享许可发布,以促进所包含下游任务中更多语言多样化的研究。
引用
@article{arxiv.2210.14712,
title = {Bloom Library: Multimodal Datasets in 300+ Languages for a Variety of Downstream Tasks},
author = {Colin Leong and Joshua Nemecek and Jacob Mansdorfer and Anna Filighera and Abraham Owodunni and Daniel Whitenack},
journal= {arXiv preprint arXiv:2210.14712},
year = {2022}
}
备注
14 pages, 1 figure, 3 tables, accepted to and presented at EMNLP 2022