Tarab:阿拉伯语歌词与诗歌的多方言语料库
计算与语言
2026-03-18 v1
摘要
我们引入Tarab语料库,一个大规模的文化和语言资源,在统一的分析框架下汇集了阿拉伯语歌曲歌词和诗歌。该语料库包含256万行诗句和超过1350万词元,使其成为我们已知的最大的涵盖古典和当代创作的开源阿拉伯语创意文本语料库。Tarab在歌曲和诗歌之间广泛平衡,涵盖古典阿拉伯语、现代标准阿拉伯语(MSA)以及六种主要地区变体:埃及语、海湾语、黎凡特语、伊拉克语、苏丹语和马格里布阿拉伯语。语料库中代表的艺术家和诗人来自28个现代民族国家及多个历史时期,跨越从伊斯兰前时期到二十一世纪的十四个多世纪的阿拉伯语创意表达。每一行诗句都附有描述语言变体、地理来源及历史或文化背景的结构化元数据,支持跨体裁和时间的比较语言学、风格学和历时分析。我们描述了数据收集、归一化和验证流程,并呈现了变体识别和体裁区分的基础分析。该数据集在HuggingFace上公开可用,地址为 https://huggingface.co/datasets/drelhaj/Tarab。
引用
@article{arxiv.2603.16601,
title = {Tarab: A Multi-Dialect Corpus of Arabic Lyrics and Poetry},
author = {Mo El-Haj},
journal= {arXiv preprint arXiv:2603.16601},
year = {2026}
}
备注
10 pages