用于实体合并的无监督字符串变换学习
数据库
2018-07-31 v4
摘要
数据集成一直是数据管理中具有许多应用的长期挑战。数据集成的关键步骤是实体合并。它以一组重复记录的簇作为输入,并为每个簇生成一个单一的“黄金记录”,其中包含每个属性的规范值。真值发现和数据融合方法,以及主数据管理(MDM)系统,可用于实体合并。然而,为了获得更好的结果,在应用这些方法之前,需要先合并簇中的变体值(即逻辑上相同但格式不同的值)。为此,我们基于两个观察结果提出了一种数据驱动的变体值标准化方法:(1)变体值通常可以转换为相同的表示形式(例如“Mary Lee”和“Lee, Mary”),以及(2)相同的变换经常在不同的簇中重复出现(例如交换名和姓)。我们的方法首先使用无监督方法生成可以以相同方式变换(即共享一个变换)的值对组。然后将这些组呈现给人工进行验证,被批准的组用于标准化数据。在一个包含 17,497 条记录的真实数据集中,我们的方法通过向人工提出 100 个是非问题,在标准化变体值方面达到了 75% 的召回率和 99.5% 的精度,完全超越了当时最先进的数据整理工具。
引用
@article{arxiv.1709.10436,
title = {Unsupervised String Transformation Learning for Entity Consolidation},
author = {Dong Deng and Wenbo Tao and Ziawasch Abedjan and Ahmed Elmagarmid and Guoliang Li and Ihab F. Ilyas and Samuel Madden and Mourad Ouzzani and Michael Stonebraker and Nan Tang},
journal= {arXiv preprint arXiv:1709.10436},
year = {2018}
}