人工智能时代从濒危走向重生:基于集成机器学习的 Hawrami 文本分类方法
计算与语言
2024-09-26 v1
摘要
Hawrami 是库尔德语的一种方言,被归类为濒危语言,因其面临数据匮乏和使用者逐渐流失的问题。自然语言处理项目可以通过多种方法(如机器翻译、语言模型构建和语料库开发)来部分弥补濒危语言/方言的数据可用性不足。类似地,文本分类等 NLP 项目也应用于语言记录。已有若干针对库尔德语的文本分类研究,但主要集中于两种特定方言:Sorani(中库尔德语)和 Kurmanji(北库尔德语)。本文使用由两位母语者标注为 15 个类别的 6,854 篇 Hawrami 文章数据集,引入了多种文本分类模型。我们使用 K 近邻(KNN)、线性支持向量机(Linear SVM)、逻辑回归(LR)和决策树(DT)来评估这些方法在分类任务中的表现。结果表明,Linear SVM 达到了 96% 的准确率,优于其他方法。
引用
@article{arxiv.2409.16884,
title = {Shifting from endangerment to rebirth in the Artificial Intelligence Age: An Ensemble Machine Learning Approach for Hawrami Text Classification},
author = {Aram Khaksar and Hossein Hassani},
journal= {arXiv preprint arXiv:2409.16884},
year = {2024}
}
备注
19 pages, 7 tables, 14 figures