寻找实体解析的OASIS:最优渐近序贯重要性采样
机器学习
2017-06-27 v3 数据库
机器学习
摘要
实体解析(ER)对评估方法学提出了独特的挑战。虽然众包平台获取真值,但合理的采样方法必须驱动标注工作。在ER中,匹配与非匹配记录之间的极端类别不平衡,在寻求用于严格评估的统计一致估计时,会导致巨大的标注需求。本文用OASIS算法应对这一重要挑战:一种用于ER评估的采样器和F值估计器。OASIS从(有偏)辅助分布中抽取样本,该分布经选择以确保具有最优渐近方差的估计量。随着收集到新标签,OASIS通过标注者神谕的贝叶斯潜变量模型更新该辅助分布,以快速聚焦于提供更多信息未标注项。我们证明所得的F值、准确率、召回率估计量收敛于真实总体值。在各种ER数据集上对采样方法的详尽比较表明,标注量减少高达83%,且估计精度无损失。
引用
@article{arxiv.1703.00617,
title = {In Search of an Entity Resolution OASIS: Optimal Asymptotic Sequential Importance Sampling},
author = {Neil G. Marchant and Benjamin I. P. Rubinstein},
journal= {arXiv preprint arXiv:1703.00617},
year = {2017}
}
备注
13 pages, 5 figures