Masader:阿拉伯语文本与语音数据资源的元数据溯源
计算与语言
2021-10-14 v1
摘要
NLP流水线在过去几年中急剧演进。流水线的第一步是寻找合适的标注数据集以评估待解任务。遗憾的是,多数已发布数据集缺乏描述其属性的元数据标注。更不用说,缺少一个公开目录来索引与特定地区或语言相关的所有公开可用数据集。当我们考量低资源方言语言时,此问题尤为突出。本文中我们创建了 \textit{Masader}——最大的阿拉伯语NLP数据集公开目录,包含200个数据集并标注了25个属性。此外,我们开发了可扩展至其他语言的元数据标注策略。我们也对阿拉伯语NLP数据集现状作出评述并指出若干问题,提出相应建议以资应对。
引用
@article{arxiv.2110.06744,
title = {Masader: Metadata Sourcing for Arabic Text and Speech Data Resources},
author = {Zaid Alyafeai and Maraim Masoud and Mustafa Ghaleb and Maged S. Al-shaibani},
journal= {arXiv preprint arXiv:2110.06744},
year = {2021}
}