SPEAR:Python 中的半监督数据编程
机器学习
2022-10-06 v3
摘要
我们提出 SPEAR,一个用于半监督数据编程的开源 Python 库。该包实现了若干近期的数据编程方法,包括以编程方式标注和构建训练数据的功能。SPEAR 以启发式规则(或规则)的形式促进弱监督,并将噪声标签关联到训练数据集。这些噪声标签被聚合以将标签分配给未标注数据,用于下游任务。我们实现了若干标签聚合方法,这些方法先聚合噪声标签,然后以级联方式使用噪声标注集进行训练。我们的实现还包括其他联合聚合并训练文本分类任务模型的方法。因此,在我们的 Python 包中,我们集成了若干级联和联合数据编程方法,同时通过让用户定义标注函数或规则来提供数据编程的功能。代码和教程笔记本可在 https://github.com/decile-team/spear 获取。此外,详尽的文档可在 https://spear-decile.readthedocs.io/ 找到。演示我们包用法的视频教程可在此处获取。我们还展示了 SPEAR 的一些真实世界用例。
引用
@article{arxiv.2108.00373,
title = {SPEAR : Semi-supervised Data Programming in Python},
author = {Guttu Sai Abhishek and Harshad Ingole and Parth Laturia and Vineeth Dorna and Ayush Maheshwari and Rishabh Iyer and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2108.00373},
year = {2022}
}
备注
EMNLP Demonstrations - 2022