中文

FlashProfile:一个合成数据特征框架

机器学习 2019-04-17 v2

摘要

我们解决了为字符串集合学习语法特征的问题,即一组类正则表达式模式,用于简洁地描述字符串中的语法变体。现实世界的数据集通常从多个来源整理而来,往往包含各种语法格式的数据。因此,任何数据处理任务之前都有一个关键步骤,即数据格式识别。然而,在标准的大数据场景中,通过人工检查数据来识别不同格式是不可行的。先前的技术仅限于一组预定义的模式(如数字、字母、单词等),且无法控制特征的粒度。我们将语法特征定义为一个基于语法相似度对字符串进行聚类的问题,随后识别出能够简洁描述每个簇的模式。我们提出了一种在给定模式语言上合成此类特征的技术,该技术还允许通过请求期望的簇数量来进行交互式细化。利用最先进的归纳合成框架 PROSE,我们将该技术实现为 FlashProfile。在 7575 个大型真实数据集上的 153153 个任务中,我们观察到中位特征提取时间仅为 0.7\sim\,0.7\,s。此外,我们表明,在诸如 FlashFill 等编程示例(PBE)工作流中,获取语法特征可能允许更准确地合成程序,即使用更少的示例。

关键词

引用

@article{arxiv.1709.05725,
  title  = {FlashProfile: A Framework for Synthesizing Data Profiles},
  author = {Saswat Padhi and Prateek Jain and Daniel Perelman and Oleksandr Polozov and Sumit Gulwani and Todd Millstein},
  journal= {arXiv preprint arXiv:1709.05725},
  year   = {2019}
}

备注

28 pages, SPLASH (OOPSLA) 2018