中文

无需实体匹配的分布式数据集快速学习

机器学习 2016-03-15 v1 分布式、并行与集群计算

摘要

考虑以下数据融合场景:两个数据集/节点包含由部分共享特征描述的相同真实世界实体,例如同一客户群的银行和保险公司记录。我们的目标是在两个域的叉积空间中学习一个分类器,且在困难情况下无可用共享ID——例如由于匿名化。传统上,该问题首先通过解决实体匹配并以标准方式随后学习分类器来处理。我们提出了一种端到端解决方案,基于最近引入的拉德马赫观测(Rademacher observations,rados)概念绕过实体匹配。非正式地,我们将需要解决实体解析的基于样本的损失的最小化,替换为在rados上的等效(不同)损失的最小化。除其他外,我们展示的关键性质有:(i) 这些rados的一个潜在巨大子集不需要执行实体匹配;(ii) 可证明在这些rados上最小化rado损失的算法,其时间和空间复杂度小于最小化等效样本损失的算法。最后,我们放宽了模型的一个关键假设,即数据在节点间垂直划分——在这种情况下,我们甚至不知道实体解析解的存在。在此更通用的设定下,实验验证了甚至可能显著击败事后最优节点。

关键词

引用

@article{arxiv.1603.04002,
  title  = {Fast Learning from Distributed Datasets without Entity Matching},
  author = {Giorgio Patrini and Richard Nock and Stephen Hardy and Tiberio Caetano},
  journal= {arXiv preprint arXiv:1603.04002},
  year   = {2016}
}