ULF:基于交叉验证的无监督标注函数校正方法用于弱监督
机器学习
2024-01-05 v4
摘要
一种替代人工数据标注的高性价比方案是弱监督(WS),即利用一组预定义的标注函数(LFs)——为相关类别生成伪标签的基于规则的机制——来自动标注数据样本。本文中,我们基于 k 折交叉验证原理研究用于 WS 的降噪技术。我们提出一种用于无监督标注函数校正的新算法 ULF,其通过利用在除部分 LFs 外的所有 LFs 上训练的模型来识别并纠正留出 LFs 特有的偏差,从而对 WS 数据进行去噪。具体而言,ULF 通过在高度可靠的交叉验证样本上重新估计分配方式,来细化 LFs 到各类别的分配。在多个数据集上的评估证实了 ULF 在无需人工标注的情况下增强 WS 学习的有效性。
引用
@article{arxiv.2204.06863,
title = {ULF: Unsupervised Labeling Function Correction using Cross-Validation for Weak Supervision},
author = {Anastasiia Sedova and Benjamin Roth},
journal= {arXiv preprint arXiv:2204.06863},
year = {2024}
}
备注
EMNLP'23