乌兹别克语停用词检测的准确性:以“学校语料库”为例的个案研究
计算与语言
2022-09-16 v1
摘要
停用词对于自然语言处理中的信息检索与文本分析研究任务非常重要。当前工作提出了一种评估停用词列表质量的方法,旨在实现自动构建技术。尽管本文提出的方法在乌兹别克语自动生成的停用词列表上进行了测试,但经适当修改后可应用于来自同一语系或具有黏着特性的类似语言。由于乌兹别克语属于黏着语语系,可以解释该语言中停用词的自动检测比屈折语中更为复杂。此外,我们以“学校语料库”为例整合了先前关于停用词检测的工作,探究如何自动分析乌兹别克语文本中停用词的检测。本文致力于回答:是否存在评估乌兹别克语文本可用停用词的良好方法,或者是否可能通过研究唯一词概率的数值特征来确定乌兹别克语句子的哪一部分包含大部分停用词。结果显示停用词列表具有可接受准确性。
引用
@article{arxiv.2209.07053,
title = {Accuracy of the Uzbek stop words detection: a case study on "School corpus"},
author = {Khabibulla Madatov and Shukurla Bekchanov and Jernej Vičič},
journal= {arXiv preprint arXiv:2209.07053},
year = {2022}
}
备注
In proceedings of The International Conference and Workshop on Agglutinative Language Technologies as a challenge of Natural Language Processing (ALTNLP), June 7-8, 2022, Koper, Slovenia