CLUENER2020:面向中文的细粒度命名实体识别数据集与基准
计算与语言
2020-01-22 v4 信息检索
机器学习
摘要
本文介绍了来自CLUE组织的NER数据集(CLUENER2020),这是一个定义良好的中文命名实体识别细粒度数据集。CLUENER2020包含10个类别。除人物、组织、地点等常见标签外,它还包含更多样化的类别。它比当前其他中文NER数据集更具挑战性,并能更好地反映真实世界应用。为进行比较,我们将若干最先进(SOTA)基线作为序列标注任务实现,并报告了人类表现及其分析。为促进未来中文细粒度NER的研究,我们发布了数据集、基线及排行榜。
引用
@article{arxiv.2001.04351,
title = {CLUENER2020: Fine-grained Named Entity Recognition Dataset and Benchmark for Chinese},
author = {Liang Xu and Yu tong and Qianqian Dong and Yixuan Liao and Cong Yu and Yin Tian and Weitang Liu and Lu Li and Caiquan Liu and Xuanwei Zhang},
journal= {arXiv preprint arXiv:2001.04351},
year = {2020}
}
备注
6 pages, 5 tables, 1 figure