中文

WikiGoldSK:面向斯洛伐克语命名实体识别的标注数据集、基线及少样本学习实验

计算与语言 2023-04-11 v1 人工智能

摘要

命名实体识别(NER)是一项基础 NLP 任务,具有广泛的实际应用。最先进 NER 方法的性能依赖于高质量人工标注数据集,而某些语言仍缺乏此类数据。本工作旨在通过引入 WikiGoldSK——首个规模可观的人工标注斯洛伐克语 NER 数据集,来改善斯洛伐克语的此状况。我们通过评估最先进多语预训练语言模型并将其与现有银标准斯洛伐克语 NER 数据集比较来对该数据集进行基准测试。我们还进行了少样本实验,表明在银标准数据集上训练可取得更好结果。为赋能未来基于斯洛伐克语 NER 的工作,我们在 https://github.com/NaiveNeuron/WikiGoldSK 以许可条款公开发布数据集、代码及训练模型。

关键词

引用

@article{arxiv.2304.04026,
  title  = {WikiGoldSK: Annotated Dataset, Baselines and Few-Shot Learning Experiments for Slovak Named Entity Recognition},
  author = {Dávid Šuba and Marek Šuppa and Jozef Kubík and Endre Hamerlik and Martin Takáč},
  journal= {arXiv preprint arXiv:2304.04026},
  year   = {2023}
}

备注

BSNLP 2023 Workshop at EACL 2023