数据湖的最小监督属性融合
数据库
2017-01-05 v1
摘要
聚合分析,例如跨产品类别比较国家层面销售与全球市场份额,常因缺乏公共连接属性(例如类别)而变得复杂,这些属性在不同地理或零售链的不同数据集之间即使在不相关数据被技术性地摄入公共数据湖后也常不可用。有时这是缺失数据问题,而在其他情况下可能是固有的,例如不同地理数据库中的记录可能实际描述不同的产品“SKU”,或遵循不同的分类规范。记录链接技术可用于自动将不同数据源中的产品映射到一组公共全局属性,从而支持执行联邦聚合连接。传统记录链接技术通常是无监督的,依赖跨属性的文本相似性特征来估计匹配。本文中,我们提出一种集成模型,结合使用贝叶斯网络模型的最小监督与无监督文本匹配,以自动化此类“属性融合”。我们在一大量来自市场研究场景的真实数据上展示方法结果,并与标准记录匹配算法比较。最后我们说明属性融合如何使用机器学习作为数据湖管理特征包含,特别是我们的方法也为匹配提供置信度值,从而在需要时可支持人工干预。
引用
@article{arxiv.1701.01094,
title = {Minimally-Supervised Attribute Fusion for Data Lakes},
author = {Karamjit Singh and Garima Gupta and Gautam Shroff and Puneet Agarwal},
journal= {arXiv preprint arXiv:1701.01094},
year = {2017}
}