构建大规模姓名消歧数据集的框架:算法、可视化与人机协作
社会与信息网络
2020-07-07 v1
摘要
我们提出一个称为 WhoisWho 的手动标注作者姓名消歧(AND)数据集,包含 399,255 篇文档和 45,187 位不同作者,涉及 421 个歧义作者名。为标注如此海量且高精度的 AND 数据,我们提出了一种新颖的标注框架,使人与计算机高效且精确地协作。在该框架内,我们还提出一种归纳式消歧模型,用于分类两篇文档是否属于同一作者。我们在 WhoisWho 上评估了所提方法及其他最先进的消歧方法。实验结果表明:(1) 我们的模型在这一具挑战性的基准上优于其他消歧算法。(2) AND 问题在很大程度上仍未解决,需要更深入的研究。我们相信如此大规模的基准将为作者姓名消歧任务带来巨大价值。我们还进行了若干实验,证明我们的标注框架可协助标注者高效得出准确结果,并有效消除人工标注者产生的错误标签问题。
引用
@article{arxiv.2007.02086,
title = {A framework for constructing a huge name disambiguation dataset: algorithms, visualization and human collaboration},
author = {Zhuoyue Xiao and Yutao Zhang and Bo Chen and Xiaozhao Liu and Jie Tang},
journal= {arXiv preprint arXiv:2007.02086},
year = {2020}
}