一种用于自监督主动学习与标签纠正的基于置信度的获取模型
计算与语言
2025-03-10 v3 机器学习
摘要
有监督神经方法受其依赖于大型精细标注数据集的制约,这一要求对序列任务尤为繁琐。标注质量往往随着从专家标注向众包标注的转变而下降。为应对这些挑战,我们提出 CAMEL(用于高效自监督主动学习的基于置信度的获取模型),一种针对序列多输出问题的基于池的主动学习框架。CAMEL 具有两个核心特征:(1)它仅要求专家标注所选序列的一小部分;(2)它为序列的其余部分促进自监督。通过部署标签纠正机制,CAMEL 也可用于数据清洗。我们在两个序列任务上评估 CAMEL,特别关注对话信念追踪——一个受限于有限且含噪数据集的任务。我们的实验表明,CAMEL 在效率方面显著优于基线。此外,我们的方法所建议的数据纠正有助于整体提升所得数据集的质量。
引用
@article{arxiv.2310.08944,
title = {A Confidence-based Acquisition Model for Self-supervised Active Learning and Label Correction},
author = {Carel van Niekerk and Christian Geishauser and Michael Heck and Shutong Feng and Hsien-chin Lin and Nurul Lubis and Benjamin Ruppik and Renato Vukovic and Milica Gašić},
journal= {arXiv preprint arXiv:2310.08944},
year = {2025}
}