中文

1010 亿阿拉伯语词数据集

计算与语言 2024-05-06 v1

摘要

近年来,大型语言模型在自然语言处理领域取得了显著进展,尤其在以英语为中心的领域。这些进展树立了全球基准,激励了开发能够准确理解和生成阿拉伯语的阿拉伯语大型语言模型的努力。尽管如此,一个关键挑战仍然存在:阿拉伯语大型语言模型可能存在偏见,这主要归因于它们依赖由英语数据翻译成阿拉伯语的数据集。这不仅损害了生成内容的真实性,也反映了更广泛的问题——阿拉伯语原始高质量语言数据的稀缺。本研究旨在解决阿拉伯世界的数据稀缺情况,并鼓励开发符合阿拉伯语语言及其地区细微差异的语言模型。我们开展了大规模数据挖掘项目,从 Common Crawl WET 文件中提取大量阿拉伯语文本。提取的数据经过严格的清洗和去重处理,采用创新技术确保数据集的完整性和唯一性。结果是 1010 亿阿拉伯语词数据集,这是目前最大的阿拉伯语数据集,可显著促进真正符合阿拉伯语语言特征的大型语言模型的开发。本研究不仅凸显了创建在语言和文化上准确的阿拉伯语大型语言模型的潜力,也为未来研究在增强阿拉伯语语言模型真实性方面树立了先例。

关键词

引用

@article{arxiv.2405.01590,
  title  = {101 Billion Arabic Words Dataset},
  author = {Manel Aloui and Hasna Chouikhi and Ghaith Chaabane and Haithem Kchaou and Chehir Dhaouadi},
  journal= {arXiv preprint arXiv:2405.01590},
  year   = {2024}
}