中文

通过检测行与类型模式整理杂乱的 CSV 文件

数据库 2019-07-29 v1

摘要

众所周知,数据科学家将大部分时间花在为分析准备数据上。这一准备阶段的第一步之一是从原始存储格式加载数据。逗号分隔值(CSV)文件因其简单性和表面上的易用性而成为表格数据的流行格式。然而,CSV 文件的格式标准并未被一致遵循,因此每个文件在加载数据之前都需要人工检查并可能进行修复,这对于本应是数据科学中最简单环节之一的任务而言是巨大的人力浪费。从 CSV 文件中检索数据的首要且最关键的步骤是确定文件的方言,例如单元格分隔符和引号字符。现有的方言检测方法很少且不够稳健。在本文中,我们提出了一种基于解析数据文件数据一致性新度量的方言检测方法。我们的方法在大型真实世界 CSV 文件语料库上实现了 97% 的总体准确率,并且与现有方法(包括 Python 标准库中的方法)相比,在杂乱 CSV 文件上的准确率提高了近 22%。

关键词

引用

@article{arxiv.1811.11242,
  title  = {Wrangling Messy CSV Files by Detecting Row and Type Patterns},
  author = {Gerrit J. J. van den Burg and Alfredo Nazabal and Charles Sutton},
  journal= {arXiv preprint arXiv:1811.11242},
  year   = {2019}
}