中文

文学领域主角标注器——面向人物实体链接的新数据集与方法

计算与语言 2021-10-05 v1

摘要

长文本(如小说)的语义标注在自然语言处理(NLP)中仍是一项开放挑战。本研究探讨检测人物实体并为其分配唯一身份的问题,即在小说中识别人物(尤其是主要角色)。我们提出了一种人物实体链接方法(命名实体识别与消歧)以及新的测试数据集。这些数据集包含来自 13 部不同体裁经典小说的 1,300 个句子,由小说读者手动标注。我们在 protagonistTagger 中实现的对文本中文学角色进行识别的流程包括两个阶段:(1)人物的命名实体识别(NER),(2)命名实体消歧(NED)——基于近似文本匹配,将每个被识别出的人物与文学角色的全名相匹配。protagonistTagger 在所准备的测试集上取得了超过 83% 的精确率与召回率。最后,我们收集了一个由 protagonistTagger 标注的 13 部全文小说语料,其中包含超过 35,000 次文学角色提及。

关键词

引用

@article{arxiv.2110.01349,
  title  = {Protagonists' Tagger in Literary Domain -- New Datasets and a Method for Person Entity Linkage},
  author = {Weronika Łajewska and Anna Wróblewska},
  journal= {arXiv preprint arXiv:2110.01349},
  year   = {2021}
}