中文

印地语新型语言资源:美学文本语料库与综合停用词元列表

计算与语言 2022-08-02 v1

摘要

本文旨在补充致力于将非英语语言纳入自然语言处理研究的研究人员的贡献。我们创建并发布了两种新型印地语语言资源供公众使用。第一种资源是一个语料库,包含近千篇跨越百余年的虚构与非虚构预处理文本。第二种资源是一个详尽的停用词元列表,该列表由跨越多个领域的 12 个语料库生成,包含超过 1300 万词,从中生成了超过 200,000 个词元,以及 11 个公开可用的停用词列表(包含超过 1000 词,从中生成了近 400 个唯一词元)。本研究强调使用停用词元而非停用词,原因在于停用词列表中包含词的多种(而非全部)形态形式,而停用词元仅包含词根形式,必要时可由此派生变体。还观察到,与停用词相比,停用词元在多个来源间更为一致。为生成停用词元列表,我们考察了词元的词性但予以舍弃,因为发现词在频率列表中的排位与其词性之间无显著相关性。该停用词元列表采用比较方法进行评估。一项形式化评估方法作为本研究的未来工作被提出。

关键词

引用

@article{arxiv.2002.00171,
  title  = {Novel Language Resources for Hindi: An Aesthetics Text Corpus and a Comprehensive Stop Lemma List},
  author = {Gayatri Venugopal-Wairagade and Jatinderkumar R. Saini and Dhanya Pramod},
  journal= {arXiv preprint arXiv:2002.00171},
  year   = {2022}
}

备注

7 pages, 3 figures