基于人工与自动标注的孟加拉语新闻分类机器学习与深度学习方法
人工智能
2022-10-21 v1
摘要
由于文本分类、文本挖掘、情感分析、词性标注、命名实体识别、文本蕴含等诸多应用,自然语言处理(NLP)研究日益重要。本文介绍了若干基于人工与自动标注的孟加拉语新闻分类机器学习与深度学习方法。我们实现了若干机器学习(ML)与深度学习(DL)算法。ML算法包括逻辑回归(LR)、随机梯度下降(SGD)、支持向量机(SVM)、随机森林(RF)和K近邻(KNN),并与词袋(BoW)、词频-逆文档频率(TF-IDF)和Doc2Vec嵌入模型结合使用。DL算法包括长短期记忆网络(LSTM)、双向LSTM(BiLSTM)、门控循环单元(GRU)和卷积神经网络(CNN),并与Word2vec、Glove和FastText词嵌入模型结合使用。我们利用潜在狄利克雷分配(LDA)开发了自动标注方法,并研究了单标签与多标签文章分类方法的性能。为考察性能,我们从零构建了Potrika——最大且最全面的孟加拉语新闻分类数据集,包含来自孟加拉国六个热门在线新闻门户2014–2020年间的664,880篇新闻文章,涵盖八个不同类别,含1.8551亿词和1257万句。GRU与Fasttext在人工标注数据上以91.83%取得最高准确率。在自动标注情形下,KNN与Doc2Vec分别以57.72%和75%在单标签与多标签数据上取得最高准确率。本文所开发的方法有望推动孟加拉语及其他语言的研究。
引用
@article{arxiv.2210.10903,
title = {Machine and Deep Learning Methods with Manual and Automatic Labelling for News Classification in Bangla Language},
author = {Istiak Ahmad and Fahad AlQurashi and Rashid Mehmood},
journal= {arXiv preprint arXiv:2210.10903},
year = {2022}
}
备注
29 pages, 30 figures