HmBlogs:一个大型通用波斯语语料库
计算与语言
2021-11-04 v1
摘要
本文针对低资源语言波斯语引入 hmBlogs 语料库。该语料库基于约 15 年间来自波斯语博客空间的近 2000 万篇博客文章集合整理而成,包含超过 68 亿个词元。可以断言,该语料库是目前为波斯语独立整理的最大波斯语语料库。该语料库以原始与预处理两种形式提供,并基于预处理语料库生成了若干词嵌入模型。借助所提供的模型,将 hmBlogs 与波斯语中若干最重要的可用语料库进行比较,结果显示 hmBlogs 语料库优于其他语料库。这些评估也呈现了语料库、评估数据集、模型生成方法、不同超参数乃至评估方法的重要性与影响。除评估语料库及其生成的语言模型外,本研究还提出了一个语义类比数据集。
引用
@article{arxiv.2111.02362,
title = {HmBlogs: A big general Persian corpus},
author = {Hamzeh Motahari Khansari and Mehrnoush Shamsfard},
journal= {arXiv preprint arXiv:2111.02362},
year = {2021}
}
备注
22 pages