naab:一个即用型即插即用的波斯语语料库
计算与语言
2024-12-24 v2
摘要
大型语言模型(LLMs)的兴起改变了众多自然语言处理(NLP)任务,但其在低资源与中等资源语言(如波斯语)上的表现仍落后于英语等资源丰富语言。为弥补这一差距,我们推出naab——最大规模的公开可用、已清洗且即用型的波斯语文本语料库。naab包含130GB数据,涵盖超过2.5亿段落与150亿词。该语料库以波斯语单词NAAB(意为“纯净”或“优质”)命名,可通过Hugging Face开放获取,为研究者提供宝贵的波斯语NLP任务资源。除naab外,我们提供naab-raw(该数据集的未处理版本)以及预处理工具包,供用户清洗自定义语料。这些资源赋能NLP研究者与从业者,尤其是关注低资源语言者,以提升其领域内LLMs的性能,并缩小资源丰富与资源匮乏语言间的差距。
引用
@article{arxiv.2208.13486,
title = {naab: A ready-to-use plug-and-play corpus for Farsi},
author = {Sadra Sabouri and Elnaz Rahmati and Soroush Gooran and Hossein Sameti},
journal= {arXiv preprint arXiv:2208.13486},
year = {2024}
}