ED2:用于错误检测的两阶段主动学习——技术报告
机器学习
2019-08-20 v1 数据库
机器学习
摘要
传统的错误检测方法需要用户定义的参数和规则。因此,用户必须同时了解错误检测系统和数据。然而,我们也可以将错误检测表述为仅需领域专业知识的半监督分类问题。这种方法面临双重挑战:(1) 以能使分类模型识别各类数据错误的方式表示数据;(2) 挑选最有价值的数据值用于学习。本文中,我们以新的示例驱动错误检测方法ED2应对这些挑战。首先,我们提出一种用于主动学习的新型二维多分类器采样策略。其次,我们提出新颖的多列特征。这些技术的结合应用使分类任务快速收敛且检测精度高。在多个真实数据集上,ED2平均仅需少于1%的标签即可超越现有错误检测方法。本报告扩展了同行评审论文“ED2: A Case for Active Learning in Error Detection”。该项目所有源代码均可在GitHub上获取。
引用
@article{arxiv.1908.06309,
title = {ED2: Two-stage Active Learning for Error Detection -- Technical Report},
author = {Felix Neutatz and Mohammad Mahdavi and Ziawasch Abedjan},
journal= {arXiv preprint arXiv:1908.06309},
year = {2019}
}