记录地理与语境多样化的数据源:BigScience 语言数据与资源目录
计算与语言
2022-01-26 v1 数据库
摘要
近年来,大规模数据收集工作优先考虑收集的数据量,以提升大语言模型的建模能力。然而,这种优先次序引发了对数据集中所代表的数据主体权利的担忧,特别是考虑到由于缺乏足够的文档和分析工具,审查这些数据集十分困难。注意到这些隐患,作为 BigScience 倡议的一部分,我们提出了一种以文档为先、以人为中心的数据收集项目方法。我们确定了一组地理多样化的目标语言群(阿拉伯语、巴斯克语、中文、加泰罗尼亚语、英语、法语、印度语系语言、印尼语、尼日尔-刚果语系语言、葡萄牙语、西班牙语和越南语,以及编程语言),以收集潜在数据源的元数据。为了组织这项工作,我们开发了在线目录作为支持工具,通过组织公共黑客马拉松来收集元数据。我们展示了我们的开发过程;对由此产生的资源元数据的分析(包括语言、地区和资源类型的分布);以及我们在此项工作中的经验教训。
关键词
引用
@article{arxiv.2201.10066,
title = {Documenting Geographically and Contextually Diverse Data Sources: The BigScience Catalogue of Language Data and Resources},
author = {Angelina McMillan-Major and Zaid Alyafeai and Stella Biderman and Kimbo Chen and Francesco De Toni and Gérard Dupont and Hady Elsahar and Chris Emezue and Alham Fikri Aji and Suzana Ilić and Nurulaqilla Khamis and Colin Leong and Maraim Masoud and Aitor Soroa and Pedro Ortiz Suarez and Zeerak Talat and Daniel van Strien and Yacine Jernite},
journal= {arXiv preprint arXiv:2201.10066},
year = {2022}
}
备注
8 pages plus appendix and references