Sherlock:一种用于语义数据类型检测的深度学习方法
机器学习
2019-05-28 v1 数据库
信息检索
机器学习
摘要
正确检测数据列的语义类型对于自动化数据清洗、模式匹配和数据发现等数据科学任务至关重要。现有的数据准备与分析系统依赖字典查找和正则表达式匹配来检测语义类型。然而,这些基于匹配的方法通常对脏数据不够鲁棒,且只能检测有限数量的类型。我们提出了 Sherlock,一种用于检测语义类型的多输入深度神经网络。我们在从 VizNet 语料库获取的 686,765 个数据列上训练 Sherlock,方法是将 DBpedia 中的 78 种语义类型与列标题进行匹配。我们用描述列值的统计属性、字符分布、词嵌入和段落向量的 1,588 个特征来刻画每个匹配列。Sherlock 取得了 0.89 的支持加权 F 分数,超过了机器学习基线、字典与正则表达式基准以及众包标注的一致性结果。
引用
@article{arxiv.1905.10688,
title = {Sherlock: A Deep Learning Approach to Semantic Data Type Detection},
author = {Madelon Hulsebos and Kevin Hu and Michiel Bakker and Emanuel Zgraggen and Arvind Satyanarayan and Tim Kraska and Çağatay Demiralp and César Hidalgo},
journal= {arXiv preprint arXiv:1905.10688},
year = {2019}
}
备注
KDD'19