中文

DCoM:一种用于语义数据类型检测的深度列映射器

机器学习 2021-06-25 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

语义数据类型的检测在数据科学中是一项非常关键的任务,用于自动化数据清洗、模式匹配、数据发现、语义数据类型归一化以及敏感数据识别。现有方法包括基于正则表达式或字典查找的方法,它们对脏数据及未见过的数据不够鲁棒,且可预测的语义数据类型数量非常有限。现有的机器学习方法从数据中提取大量工程特征,并为此构建逻辑回归、随机森林或前馈神经网络。本文中,我们引入 DCoM,一组基于多输入 NLP 的深度神经网络来检测语义数据类型,其中我们不再从数据中提取大量特征,而是将列(或实例)的原始值作为文本输入模型。我们在从 VizNet 语料库提取的 686,765 个数据列上以 78 种不同语义数据类型训练 DCoM。在同一数据集上,DCoM 以相当显著的差距优于其他现有结果。

关键词

引用

@article{arxiv.2106.12871,
  title  = {DCoM: A Deep Column Mapper for Semantic Data Type Detection},
  author = {Subhadip Maji and Swapna Sourav Rout and Sudeep Choudhary},
  journal= {arXiv preprint arXiv:2106.12871},
  year   = {2021}
}

备注

9 pages, 2 figures, 7 tables