ZeroER:使用零标注样本的实体解析
数据库
2020-04-07 v2 机器学习
摘要
实体解析(ER)指的是匹配一个或多个关系中指向同一真实世界实体的记录的问题。尽管有监督机器学习(ML)方法取得了最先进的结果,但它们需要大量标注样本,而这些样本获取代价高昂且常常不可行。我们研究一个困扰实践者的重要问题:是否可能设计一种有效的 ER 算法,其需要零标注样本,却能取得与有监督方法相当的性能?在本文中,我们通过提出的方法 ZeroER 给出肯定回答。我们的方法基于一个简单观察——匹配的相似度向量应不同于非匹配的相似度向量。将这一洞见付诸实践需要若干技术创新。首先,我们提出一个基于高斯混合模型的简单而强大的生成模型,用于学习匹配与不匹配分布。其次,我们提出一种为 ER 定制的自适应正则化技术,缓解特征过拟合问题。最后,我们以新颖方式将传递性性质纳入生成模型,从而提高了准确率。在五个基准 ER 数据集上,我们展示 ZeroER 大幅优于现有无监督方法,并取得了与有监督方法相当的性能。
引用
@article{arxiv.1908.06049,
title = {ZeroER: Entity Resolution using Zero Labeled Examples},
author = {Renzhi Wu and Sanya Chaba and Saurabh Sawlani and Xu Chu and Saravanan Thirumuruganathan},
journal= {arXiv preprint arXiv:1908.06049},
year = {2020}
}
备注
Published at 2020 ACM SIGMOD International Conference on Management of Data