中文

吉尔吉斯语多标签主题分类基准评测

计算与语言 2023-08-31 v1

摘要

吉尔吉斯语在现代自然语言处理资源方面代表性极低。在这项工作中,我们提出了一个吉尔吉斯语主题分类的新公开基准,引入了基于从新闻网站 24.KG 收集和标注数据的数据集,并给出了多标签设置下新闻分类的若干基线模型。我们训练并评估了经典统计模型与神经模型,报告了分数,讨论了结果,并提出了未来工作的方向。

关键词

引用

@article{arxiv.2308.15952,
  title  = {Benchmarking Multilabel Topic Classification in the Kyrgyz Language},
  author = {Anton Alekseev and Sergey I. Nikolenko and Gulnara Kabaeva},
  journal= {arXiv preprint arXiv:2308.15952},
  year   = {2023}
}

备注

Accepted to AIST 2023