中文

HoloDetect:面向错误检测的少样本学习

数据库 2019-04-05 v1

摘要

我们提出了一种用于错误检测的少样本学习框架。我们表明,数据增强(一种弱监督形式)是训练高质量、基于机器学习的错误检测模型的关键,此类模型仅需极少的人工参与。我们的框架由两部分组成:(1) 一个富有表现力的模型,用于学习能够捕捉错误固有语法与语义异构性的丰富表示;以及 (2) 一个数据增强模型,该模型在给定少量干净记录种子的情况下,利用数据集特定的变换自动生成额外的训练数据。我们的核心见解是以弱监督方式从含噪输入数据集中学习数据增强策略。我们表明,我们的框架在展现不同类型与数量错误的多样化数据集上,以约94%的平均精确率和约93%的平均召回率检测错误。我们将我们的方法相较于一套涵盖从传统基于规则的方法到基于集成与主动学习方法的错误检测方法进行对比。我们表明,数据增强带来了平均20个F1点的提升,同时与其他机器学习方法相比,它所需的标注样本量少3倍。

关键词

引用

@article{arxiv.1904.02285,
  title  = {HoloDetect: Few-Shot Learning for Error Detection},
  author = {Alireza Heidari and Joshua McGrath and Ihab F. Ilyas and Theodoros Rekatsinas},
  journal= {arXiv preprint arXiv:1904.02285},
  year   = {2019}
}

备注

18 pages,