利用语言处理技术增强普什图语文本的单标签与多标签分类
计算与语言
2023-05-08 v1 机器学习
摘要
文本分类已成为多个领域中的关键任务,促使大量研究致力于为国内与国际语言开发自动化文本分类系统。然而,能够处理本地语言的自动化文本分类系统的需求正日益增长。本研究旨在建立普什图语文本的自动分类系统。为实现该目标,我们构建了普什图语文档数据集,并应用多种模型,包括统计与神经机器学习模型,如 DistilBERT-base-multilingual-cased、多层感知机、支持向量机、K近邻、决策树、高斯朴素贝叶斯、多项式朴素贝叶斯、随机森林和逻辑回归,以识别最有效方法。我们还评估了两种不同特征提取方法:词袋模型和词频-逆文档频率。在单标签多类分类中,使用 MLP 分类算法与 TFIDF 特征提取方法取得了 94% 的平均测试准确率。类似地,MLP+TFIDF 取得了最佳结果,F1 度量为 0.81。此外,使用 DistilBERT 等预训练语言表示模型在普什图语文本分类中展现出有前景的结果;然而,本研究强调,为特定语言开发专用分词器对于取得合理结果至关重要。
引用
@article{arxiv.2305.03201,
title = {Enhancing Pashto Text Classification using Language Processing Techniques for Single And Multi-Label Analysis},
author = {Mursal Dawodi and Jawid Ahmad Baktash},
journal= {arXiv preprint arXiv:2305.03201},
year = {2023}
}
备注
https://nlpai2023.org/papers?fbclid=IwAR2v29d3nFUaIx9U-rnfN8pqJu1tXBS9P9OV1IJnsbJ0QHN9JZAMPhZA7Ds