中文

人物索引挑战:从杂乱短文本中抽取人物

计算与语言 2021-08-02 v1

摘要

当文本中提及人物时,若使用其名、姓和/或中间名,其名称的使用方式、排列顺序以及是否缩写可能存在很大差异。若多个以极不相同方式连续提及的人物出现,尤其是短文本,会被视为“杂乱”。一旦出现歧义名称,与人物的关联便可能无法正确推断。尽管存在这些情形,本文仍探讨无监督算法从短文本构建人物索引的效果。我们将人物索引定义为按姓名明确编录个体的结构化表格。首先,我们给出该问题的形式化定义,并描述生成供未来评估使用的基础真值数据的流程。为初步应对该挑战,我们实现了一个基线方法。利用所提出的评估策略,我们测试了该基线的性能并给出进一步改进建议。源代码已公开以供未来研究使用。

关键词

引用

@article{arxiv.2011.07990,
  title  = {The Person Index Challenge: Extraction of Persons from Messy, Short Texts},
  author = {Markus Schröder and Christian Jilek and Michael Schulze and Andreas Dengel},
  journal= {arXiv preprint arXiv:2011.07990},
  year   = {2021}
}

备注

7 pages, accepted at ICAART 2021