乌兹别克语文本分类数据集与分析
计算与语言
2023-03-01 v1
摘要
文本分类是自然语言处理(NLP)中的一项重要任务,其目标是将文本数据归类到预定义类别中。本研究分析了作为文本分类一部分的多标签新闻分类任务的 dataset 创建步骤与评估技术。我们首先提出一个新获取的乌兹别克语文本分类数据集,它从 10 个不同新闻与出版社网站收集,涵盖新闻、出版与法律文本的 15 个类别。我们还在此新创建的数据集上对传统词袋模型到深度学习架构等不同模型进行了全面评估。实验表明,基于循环神经网络(RNN)和卷积神经网络(CNN)的模型优于基于规则的模型。最佳性能由 BERTbek 模型取得,它是基于 transformer 的 BERT 模型并在乌兹别克语语料上训练。我们的发现为乌兹别克语文本分类的进一步研究提供了良好基线。
引用
@article{arxiv.2302.14494,
title = {Text classification dataset and analysis for Uzbek language},
author = {Elmurod Kuriyozov and Ulugbek Salaev and Sanatbek Matlatipov and Gayrat Matlatipov},
journal= {arXiv preprint arXiv:2302.14494},
year = {2023}
}
备注
Preprint of the paper accepted to The 10th Language & Technology Conference: Human Language Technologies as a Challenge for Computer Science and Linguistics. April 21-23, 2023, Poznan, Poland