中文

一个阿姆哈拉语新闻文本分类数据集

计算与语言 2021-03-11 v1 人工智能

摘要

在自然语言处理中,文本分类是我们试图解决的主要问题之一,其在语言分析中的用途无可争议。标注训练数据的缺乏使得在阿姆哈拉语等低资源语言中执行这些任务更为困难。收集、标注此类数据并使其具有价值的工作,将鼓励青年研究者、高校及机器学习从业者在其语言中实施现有的分类模型。在这篇短文中,我们旨在介绍一个阿姆哈拉语文本分类数据集,其包含超过 5 万篇新闻文章,分为 6 个类别。该数据集随附简易基线性能一并公开,以鼓励研究与更优性能的试验。

关键词

引用

@article{arxiv.2103.05639,
  title  = {An Amharic News Text classification Dataset},
  author = {Israel Abebe Azime and Nebil Mohammed},
  journal= {arXiv preprint arXiv:2103.05639},
  year   = {2021}
}