仅需您少许帮助即可发现实体
信息检索
2018-10-25 v1
摘要
将文本中像人物、组织、书籍、音乐团体及其歌曲等实体链接到知识库(KBs)是许多下游搜索和挖掘应用的基础任务。实现高消歧准确率关键依赖于对知识库中实体的丰富且整体的表示。对于热门实体,这种表示可以容易地从维基百科中挖掘,许多当前的实体消歧和链接方法利用了这一事实。然而,维基百科不包含只有少数人感兴趣的长尾实体,并且有时在新出现的实体被添加之前存在滞后。对于此类实体,以完全自动化方式挖掘合适的表示非常困难,导致链接准确率低下。不过,给定新实体在任何文本中出现的上下文,可以自动挖掘出高质量的表示。由于缺乏关于该实体的知识,没有方法能够以高精度自动检索这些出现,从而导致鸡生蛋蛋生鸡的问题。为此,我们的方法自动生成实体的候选出现,提示用户反馈以判定该出现是否指代所讨论的实际实体。这种反馈逐步改进知识,并使我们的方法能够提供更好的候选建议以保持用户参与度。我们提出了基于多样化与文本相关性方法梯度交织的新颖人机协同检索方法来生成候选。我们在 FACC 数据集上进行了大量实验,表明我们的方法在内在和外在度量上均令人信服地优于精心选择的基线,同时保持用户参与度。
引用
@article{arxiv.1810.10252,
title = {Discovering Entities with Just a Little Help from You},
author = {Jaspreet Singh and Johannes Hoffart and Avishek Anand},
journal= {arXiv preprint arXiv:1810.10252},
year = {2018}
}