中文

微博中新兴实体的早期发现

计算与语言 2019-07-09 v1

摘要

每日跟进出现的新兴实体对于社会趋势分析和市场研究等多种应用不可或缺。以往研究试图将特定知识库中未注册的未见实体检测为新兴实体,并因此发现非新兴实体,但由于知识库中实体的缺失并不能保证其新兴性。因此我们引入一项新任务:在真正新兴实体刚通过微博公开时被发掘,并提出一种基于时间敏感远程监督的有效方法,其利用新兴实体独特的早期上下文。使用大规模 Twitter 档案的实验结果表明,所提方法对前 500 个被发现新兴实体的精确率达 83.2%,优于基于突发检测的未见实体识别基线。除显著新兴实体外,我们的方法还能发现大量长尾及同形异义新兴实体。相对召回率评估显示,该方法检测到 Wikipedia 中新注册新兴实体的 80.4%;其中 92.4% 早于其在 Wikipedia 的注册被发现,平均提前期超过一年(571 天)。

关键词

引用

@article{arxiv.1907.03513,
  title  = {Early Discovery of Emerging Entities in Microblogs},
  author = {Satoshi Akasaki and Naoki Yoshinaga and Masashi Toyoda},
  journal= {arXiv preprint arXiv:1907.03513},
  year   = {2019}
}

备注

Fixed errata in IJCAI paper. Dataset is available here:http://www.tkl.iis.u-tokyo.ac.jp/~akasaki/ijcai19.html