用于程序化弱监督的超标签模型
机器学习
2023-03-09 v4 数据库
摘要
为减少人工标注工作量,程序化弱监督(PWS)范式将弱监督源抽象为标注函数(LFs),并引入标签模型来聚合多个LFs的输出以产生训练标签。大多数现有标签模型需要对每个数据集进行参数学习步骤。本工作中,我们提出一种超标签模型,其(一旦训练完成)可在单次前向传播中推断每个数据集的真实标签,无需针对数据集的特定参数学习。该超标签模型逼近真实标签的一个最优解析(但计算上难解)解。我们在以确保模型逼近解析最优解的方式生成的合成数据上训练模型,并基于图神经网络(GNN)构建模型,以确保模型预测对LFs(或数据点)的置换具有不变性(或等变性)。在14个真实世界数据集上,我们的超标签模型在准确率(平均提高1.4个百分点)与效率(平均提高六倍)上均优于现有最佳方法。我们的代码见https://github.com/wurenzhi/hyper_label_model
引用
@article{arxiv.2207.13545,
title = {Learning Hyper Label Model for Programmatic Weak Supervision},
author = {Renzhi Wu and Shen-En Chen and Jieyu Zhang and Xu Chu},
journal= {arXiv preprint arXiv:2207.13545},
year = {2023}
}
备注
Published as a conference paper at ICLR 2023