中文

基于机器与深度学习方法论的乌尔都语文本文档分类基准性能

计算与语言 2020-03-04 v1 机器学习

摘要

为提供乌尔都语文本文档分类的基准性能,本文的贡献是多重的。首先,它提供了一个公开可用的、针对 6 个类别手动标注的基准数据集。其次,它通过嵌入 10 种已广泛用于其他语言的基于过滤器的特征选择算法,研究了传统的基于机器学习的乌尔都语文本文档分类方法论的性能影响。第三,它首次评估了多种基于深度学习的方法论在乌尔都语文本文档分类上的性能。在这方面,为进行实验,我们改编了 10 种在英语文本分类中取得最佳性能表现的深度学习分类方法论。第四,它还利用来自 Transformer 的双向编码器表示(BERT)方法对乌尔都语进行了迁移学习性能影响的研究。第五,它评估了一种结合传统基于机器学习的特征工程与基于深度学习的自动化特征工程的混合方法的完整性。实验结果表明,名为归一化差异度量的特征选择方法配合支持向量机(SVM),在两个闭源基准数据集 CLE Urdu Digest 1000k 和 CLE Urdu Digest 1Million 上分别以 32% 和 13% 的显著优势超越了最先进(SOTA)性能。在所有三个数据集中,归一化差异度量优于其他基于过滤器的特征选择算法,因为它显著提升了所有采用的机器学习、深度学习和混合方法的性能。源代码与所提供的数据集可在 Github 仓库获取。

关键词

引用

@article{arxiv.2003.01345,
  title  = {Benchmark Performance of Machine And Deep Learning Based Methodologies for Urdu Text Document Classification},
  author = {Muhammad Nabeel Asim and Muhammad Usman Ghani and Muhammad Ali Ibrahim and Sheraz Ahmad and Waqar Mahmood and Andreas Dengel},
  journal= {arXiv preprint arXiv:2003.01345},
  year   = {2020}
}