中文

基于 TF-IDF 方法为马拉里语构建停用词表

计算与语言 2024-06-18 v1 机器学习

摘要

停用词是一种在语言中常见的词, 通常被视为在确定文档含义或重要性方面价值不大的词。这些词在大多数文本中都很常见, 且在情感分析和文本分类等任务中提供的有用信息有限。英语作为高资源语言, 利用停用词的可用性方面受到关注, 而低资源印度语言如马拉里语则非常有限, 标准化且可用于可用软件包, 但可用单词数量较少。我们的工作针对马拉里语的停用词进行精选, 使用拥有 2480 万句子的 MahaCorpus。我们采用 TF-IDF 方法结合人工评估来构建一个包含 400 个词的强大停用词表。我们将停用词移除应用于文本分类任务并展示其有效性。该工作还为低资源语言的停用词精选提供了简单方法。停用词已集成到 mahaNLP 库中, 并在 https://github.com/l3cube-pune/MarathiNLP 上公开。

关键词

引用

@article{arxiv.2406.11029,
  title  = {Curating Stopwords in Marathi: A TF-IDF Approach for Improved Text Analysis and Information Retrieval},
  author = {Rohan Chavan and Gaurav Patil and Vishal Madle and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2406.11029},
  year   = {2024}
}

备注

Accepted at I2CT 2024