中文

实体解析与联邦学习获得一种联邦式解析

数据库 2018-03-22 v2 机器学习

摘要

考虑两个数据提供方,各自维护关于共同实体的不同特征集记录。它们旨在针对整个特征集学习一个线性模型。这一关于垂直划分数据的联邦学习问题包含一个关键的上游问题:实体解析,即寻找数据集行之间的对应关系。众所周知,实体解析与学习一样,在现实世界中容易出错。尽管该问题十分重要,迄今尚无关于实体解析中的错误如何影响学习的正式评估。在本文中,我们对该问题提供了透彻的回答,阐明最优分类器、经验损失、间隔与泛化能力如何受影响。虽然我们的回答涵盖广泛的损失函数——超越恰当、凸或分类校准的——但它带来了简单的实际论据,以将实体解析升级为学习的前处理步骤。其中之一建议实体解析应旨在控制或最小化不同类别样本之间的匹配错误数。在我们的实验中,我们修改了一个简单的基于令牌的实体解析算法,使其确实旨在避免匹配属于不同类别的行,并在实体解析依赖噪声数据(这与现实领域高度相关)的设置下进行了实验。值得注意的是,我们的方法覆盖了某一参与方没有类别或仅有噪声类别记录的情况。实验表明,在实体解析期间使用类别信息能以较小的复杂性代价为学习带来显著提升。

关键词

引用

@article{arxiv.1803.04035,
  title  = {Entity Resolution and Federated Learning get a Federated Resolution},
  author = {Richard Nock and Stephen Hardy and Wilko Henecka and Hamish Ivey-Law and Giorgio Patrini and Guillaume Smith and Brian Thorne},
  journal= {arXiv preprint arXiv:1803.04035},
  year   = {2018}
}

备注

arXiv admin note: text overlap with arXiv:1711.10677