中文

寻找实体解析的OASIS:最优渐近序贯重要性采样

机器学习 2017-06-27 v3 数据库 机器学习

摘要

实体解析(ER)对评估方法学提出了独特的挑战。虽然众包平台获取真值,但合理的采样方法必须驱动标注工作。在ER中,匹配与非匹配记录之间的极端类别不平衡,在寻求用于严格评估的统计一致估计时,会导致巨大的标注需求。本文用OASIS算法应对这一重要挑战:一种用于ER评估的采样器和F值估计器。OASIS从(有偏)辅助分布中抽取样本,该分布经选择以确保具有最优渐近方差的估计量。随着收集到新标签,OASIS通过标注者神谕的贝叶斯潜变量模型更新该辅助分布,以快速聚焦于提供更多信息未标注项。我们证明所得的F值、准确率、召回率估计量收敛于真实总体值。在各种ER数据集上对采样方法的详尽比较表明,标注量减少高达83%,且估计精度无损失。

关键词

引用

@article{arxiv.1703.00617,
  title  = {In Search of an Entity Resolution OASIS: Optimal Asymptotic Sequential Importance Sampling},
  author = {Neil G. Marchant and Benjamin I. P. Rubinstein},
  journal= {arXiv preprint arXiv:1703.00617},
  year   = {2017}
}

备注

13 pages, 5 figures