中文

调整传统语言处理方法用于普什图语文本分类

计算与语言 2023-05-09 v1 人工智能 机器学习

摘要

如今,文本分类因多种目的而成为相关人员的紧要任务。因此,已开展若干研究以开发面向国内与国际语言的自动文本分类。然而,对本地语言自动文本分类系统的需求仍感欠缺。本研究的主要目标是建立普什图语自动文本分类系统。为推进此项工作,由于缺少公开的普什图语文本文档数据集,我们构建了由普什图语文档组成的普什图语语料库。此外,本研究比较了若干包含统计与神经网络机器学习技术的模型,包括多层感知机(MLP)、支持向量机(SVM)、K 近邻(KNN)、决策树、高斯朴素贝叶斯、多项式朴素贝叶斯、随机森林和逻辑回归,以发现最有效方法。进而,本研究评估了两种不同特征提取方法,包括 unigram 和词频逆文档频率(TFIDF)。随后,本研究在此情形下使用 MLP 分类算法与 TFIDF 特征提取方法获得了 94% 的平均测试准确率。

关键词

引用

@article{arxiv.2305.03737,
  title  = {Tuning Traditional Language Processing Approaches for Pashto Text Classification},
  author = {Jawid Ahmad Baktash and Mursal Dawodi and Mohammad Zarif Joya and Nematullah Hassanzada},
  journal= {arXiv preprint arXiv:2305.03737},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2305.03201