基于深度学习的数据集合并
机器学习
2018-09-06 v1 人工智能
机器学习
摘要
数据集合并是数据分析的一项关键操作。合并的一个常见需求是跨列连接同一实体的不同表面形式(例如,一个人的名字可能表示为“Douglas Adams”或“Adams, Douglas”)。类似地,本体对齐可能需要识别同一实体的不同表面形式,尤其在本体独立开发时。然而,数据管理系统目前仅限于基于字符串相等或最多使用字符串相似度来执行合并。我们提出了一种基于深度学习模型执行合并的方法。我们的方法依赖于(a)创建一个深度学习模型,将实体的表面形式映射为一组向量,使得同一实体的不同形式在向量空间中最接近;(b)使用最近邻算法对这些向量建立索引,以找到可潜在连接在一起的形式。为了构建这些模型,由于数据特征,我们不得不调整度量学习的技术;具体地,我们描述了适用于该问题的新颖样本选择技术与损失函数。为评估我们的方法,我们使用 Wikidata 作为真值,并基于约 110 万个人名(20 万身份)和 13 万公司名(7 万身份)的数据集构建模型。我们开发的模型允许以 .75-.81 的 precision@1 和 .74-.81 的召回率进行连接。我们提供了这些模型用于跨多个数据集对齐人或公司。
引用
@article{arxiv.1809.01604,
title = {Merging datasets through deep learning},
author = {Kavitha Srinivas and Abraham Gale and Julian Dolby},
journal= {arXiv preprint arXiv:1809.01604},
year = {2018}
}