中文

一个捷克新闻文本分类数据集及强基线

计算与语言 2023-07-21 v1

摘要

捷克语自然语言处理的预训练模型常在纯语言学任务(词性标注、句法分析、命名实体识别)以及相对简单的分类任务(如情感分类或单一新闻源的文章分类)上评估。作为替代,我们提出 CZEch~NEws~Classification~数据集(CZE-NEC),这是最大的捷克语分类数据集之一,由来自不同来源、跨度二十余年的新闻文章组成,可对此类模型进行更严格的评估。我们定义了四项分类任务:新闻来源、新闻类别、推断的作者性别以及星期几。为验证任务难度,我们进行了人工评估,结果显示人工表现落后于基于预训练 transformer 模型构建的强机器学习基线。此外,我们表明特定语言预训练编码器分析优于选定的商用大规模生成式语言模型。

关键词

引用

@article{arxiv.2307.10666,
  title  = {A Dataset and Strong Baselines for Classification of Czech News Texts},
  author = {Hynek Kydlíček and Jindřich Libovický},
  journal= {arXiv preprint arXiv:2307.10666},
  year   = {2023}
}

备注

12 pages, Accepted to Text, Speech and Dialogue (TSD) 2023