中文

AutoWS-Bench-101:以 100 个标签基准测试自动化弱监督

机器学习 2023-11-28 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

弱监督(WS)是一种强大的方法,可在极少或无标注数据的情况下构建标注数据集以训练监督模型。它用手工标注数据替换为聚合由标注函数(LFs)表达的多个噪声但廉价的标签估计。尽管已成功用于许多领域,弱监督的应用范围受限于为具有复杂或高维特征的领域构造标注函数的困难。为此,少量方法提出使用一小部分真值标签自动化 LF 设计过程。在本工作中,我们引入 AutoWS-Bench-101:一个在具有挑战性的 WS 设置下评估自动化 WS(AutoWS)技术的框架——一组以往难以或无法应用传统 WS 技术的多样化应用领域。尽管 AutoWS 是扩展 WS 应用范围的有前景方向,但零样本基础模型等强大方法的出现揭示了理解 AutoWS 技术如何与现代零样本或少样本学习器比较或协作的必要性。这引出了 AutoWS-Bench-101 的核心问题:给定每项任务初始的 100 个标签集合,我们询问实践者应使用 AutoWS 方法生成额外标签,还是使用某些更简单的基线,如基础模型的零样本预测或监督学习。我们观察到,在许多设置中,AutoWS 方法若要胜过简单的少样本基线,必须融入来自基础模型的信号,AutoWS-Bench-101 促进了该方向的未来研究。我们以对 AutoWS 方法的彻底消融研究作结。

关键词

引用

@article{arxiv.2208.14362,
  title  = {AutoWS-Bench-101: Benchmarking Automated Weak Supervision with 100 Labels},
  author = {Nicholas Roberts and Xintong Li and Tzu-Heng Huang and Dyah Adila and Spencer Schoenberg and Cheng-Yu Liu and Lauren Pick and Haotian Ma and Aws Albarghouthi and Frederic Sala},
  journal= {arXiv preprint arXiv:2208.14362},
  year   = {2023}
}

备注

NeurIPS 2022 Datasets and Benchmarks Track