中文

用于真实网络文档体裁识别的GINCO训练数据集

计算与语言 2022-01-12 v1

摘要

本文提出一个用于自动体裁识别的新训练数据集 GINCO,其基于1,125篇爬取的斯洛文尼亚语网络文档,包含65万词。每篇文档均使用一种新建的标注模式手动标注体裁,该模式在已有模式基础上构建,主要考量标签清晰性与标注者间一致性。该数据集包含与网络数据相关的多种挑战,如机器翻译内容、编码错误、单文档内呈现多内容等,从而能够在真实条件下评估分类器。在该数据集上的初始机器学习实验表明:(1) 前Transformer模型对这一现象的建模能力大幅更弱,宏F1指标约在0.22左右,而基于Transformer的模型取得约0.58的分数;(2) 多语言Transformer模型在该任务上的表现与 monolingual 模型相当,而后者此前已被证明在标准NLP任务上优于多语言模型。

关键词

引用

@article{arxiv.2201.03857,
  title  = {The GINCO Training Dataset for Web Genre Identification of Documents Out in the Wild},
  author = {Taja Kuzman and Peter Rupnik and Nikola Ljubešić},
  journal= {arXiv preprint arXiv:2201.03857},
  year   = {2022}
}