中文

Snorkel:利用弱监督快速创建训练数据

机器学习 2017-11-29 v1 机器学习

摘要

标注训练数据日益成为部署机器学习系统的最大瓶颈。我们提出 Snorkel,这是一种首创的系统,使用户无需手工标注任何训练数据即可训练最先进的模型。相反,用户编写标注函数来表达任意启发式规则,这些规则可能具有未知的准确性与相关性。Snorkel 在无需真实标签的情况下,通过整合我们近期提出的机器学习范式——数据编程(data programming)——的首个端到端实现来去噪其输出。基于过去一年与多家公司、机构和研究实验室合作的经验,我们提出了一个用于编写标注函数的灵活接口层。在一项用户研究中,领域专家构建模型的速度比七小时手工标注快 2.8 倍,且预测性能平均提升 45.5%。我们研究了这一新设定下的建模权衡,并提出一种用于自动化权衡决策的优化器,该优化器在每个流水线执行中可带来最高 1.8 倍加速。在与美国退伍军人事务部(U.S. Department of Veterans Affairs)和美国食品药品监督管理局(U.S. Food and Drug Administration)的两项合作中,以及在代表其他部署的四个开源文本和图像数据集上,Snorkel 相较先前的启发式方法在预测性能上平均提升 132%,并平均仅距大型手工整理训练集的预测性能差 3.60%。

关键词

引用

@article{arxiv.1711.10160,
  title  = {Snorkel: Rapid Training Data Creation with Weak Supervision},
  author = {Alexander Ratner and Stephen H. Bach and Henry Ehrenberg and Jason Fries and Sen Wu and Christopher Ré},
  journal= {arXiv preprint arXiv:1711.10160},
  year   = {2017}
}