面向多体裁中文小说命名实体识别的语料库
计算与语言
2024-10-16 v2
摘要
人物、地点、组织等实体对于文学文本分析十分重要。标注数据的缺乏阻碍了文学领域命名实体识别(NER)的研究进展。为推动文学NER研究,我们构建了规模最大的多体裁文学NER语料库,包含来自13个不同体裁的260部网络中文小说、共105,851个句子中的263,135个实体。基于该语料库,我们考察了不同体裁实体的特征。我们提出了若干基线NER模型并进行了跨体裁与跨领域实验。实验结果表明,尽管体裁差异对NER性能的影响不如文学领域与新闻领域等域差异显著,但其影响依然明显。与新闻领域NER相比,文学NER仍有较大提升空间,且由于文学作品中实体高度多样,未登录词(OOV)问题更具挑战性。我们的数据与模型已开源:https://github.com/hjzhao73/MultiGenre-ChineseNovel
引用
@article{arxiv.2311.15509,
title = {A Corpus for Named Entity Recognition in Chinese Novels with Multi-genres},
author = {Hanjie Zhao and Jinge Xie and Yuchen Yan and Yuxiang Jia and Yawen Ye and Hongying Zan},
journal= {arXiv preprint arXiv:2311.15509},
year = {2024}
}