中文

WRENCH:弱监督综合基准平台

机器学习 2021-10-12 v2 人工智能 计算与语言 机器学习

摘要

近期的弱监督(WS)方法通过从多个潜在含噪的监督源合成标签,在缓解机器学习训练数据标注瓶颈方面取得了广泛成功。然而,对这些方法的恰当度量与分析仍具挑战。首先,现有工作中使用的数据集往往私有和/或定制化,限制了标准化。其次,同名且基于相同数据的 WS 数据集常在使用标签与弱监督源方面存在差异,这是评估方差的一个显著“隐藏”来源。最后,WS 研究在评估协议与所用消融实验上常存在分歧。为解决这些问题,我们引入了基准平台 WRENCH,用于对 WS 方法进行透彻且标准化的评估。它包含 22 个用于分类与序列标注的多样真实世界数据集;一系列真实、合成与程序化生成的弱监督源;以及一个模块化、可扩展的 WS 评估框架,包含流行 WS 方法的实现。我们利用 WRENCH 对超过 120 种方法变体进行了广泛比较,以证明其作为基准平台的有效性。代码见 https://github.com/JieyuZ2/wrench。

关键词

引用

@article{arxiv.2109.11377,
  title  = {WRENCH: A Comprehensive Benchmark for Weak Supervision},
  author = {Jieyu Zhang and Yue Yu and Yinghao Li and Yujing Wang and Yaming Yang and Mao Yang and Alexander Ratner},
  journal= {arXiv preprint arXiv:2109.11377},
  year   = {2021}
}

备注

NeurIPS 2021 Datasets and Benchmarks Track