DCoM:一种用于语义数据类型检测的深度列映射器
机器学习
2021-06-25 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
语义数据类型的检测在数据科学中是一项非常关键的任务,用于自动化数据清洗、模式匹配、数据发现、语义数据类型归一化以及敏感数据识别。现有方法包括基于正则表达式或字典查找的方法,它们对脏数据及未见过的数据不够鲁棒,且可预测的语义数据类型数量非常有限。现有的机器学习方法从数据中提取大量工程特征,并为此构建逻辑回归、随机森林或前馈神经网络。本文中,我们引入 DCoM,一组基于多输入 NLP 的深度神经网络来检测语义数据类型,其中我们不再从数据中提取大量特征,而是将列(或实例)的原始值作为文本输入模型。我们在从 VizNet 语料库提取的 686,765 个数据列上以 78 种不同语义数据类型训练 DCoM。在同一数据集上,DCoM 以相当显著的差距优于其他现有结果。
引用
@article{arxiv.2106.12871,
title = {DCoM: A Deep Column Mapper for Semantic Data Type Detection},
author = {Subhadip Maji and Swapna Sourav Rout and Sudeep Choudhary},
journal= {arXiv preprint arXiv:2106.12871},
year = {2021}
}
备注
9 pages, 2 figures, 7 tables