面向斯拉夫语种的跨语言命名实体语料库
计算与语言
2024-04-09 v2 人工智能
机器学习
摘要
本文呈现了一个针对六种斯拉夫语种——保加利亚语、捷克语、波兰语、斯洛文尼亚语、俄语和乌克兰语——人工标注命名实体的语料库。这项工作是 2017 年至 2023 年间作为斯拉夫自然语言处理研讨会一部分的一系列共享任务的成果。该语料库包含 5,017 篇涵盖七个主题的文档。这些文档标注了五类命名实体。每个实体由一个类别、一个词形和一个唯一的跨语言标识符描述。我们提供了两种训练-调优数据集划分——单主题剔除和跨主题。对于每种划分,我们使用基于 Transformer 的神经网络架构并利用预训练多语言模型设定了基准——使用 XLM-RoBERTa-large 进行命名实体提及识别与分类,使用 mT5-large 进行命名实体词形还原与链接。
引用
@article{arxiv.2404.00482,
title = {Cross-lingual Named Entity Corpus for Slavic Languages},
author = {Jakub Piskorski and Michał Marcińczuk and Roman Yangarber},
journal= {arXiv preprint arXiv:2404.00482},
year = {2024}
}
备注
Published in LREC-COLING 2024 - The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation