吉尔吉斯语多标签主题分类基准评测
计算与语言
2023-08-31 v1
摘要
吉尔吉斯语在现代自然语言处理资源方面代表性极低。在这项工作中,我们提出了一个吉尔吉斯语主题分类的新公开基准,引入了基于从新闻网站 24.KG 收集和标注数据的数据集,并给出了多标签设置下新闻分类的若干基线模型。我们训练并评估了经典统计模型与神经模型,报告了分数,讨论了结果,并提出了未来工作的方向。
引用
@article{arxiv.2308.15952,
title = {Benchmarking Multilabel Topic Classification in the Kyrgyz Language},
author = {Anton Alekseev and Sergey I. Nikolenko and Gulnara Kabaeva},
journal= {arXiv preprint arXiv:2308.15952},
year = {2023}
}
备注
Accepted to AIST 2023