存在不完美标签下的主动学习最优标注者分配与采样
机器学习
2025-12-16 v1 人工智能
最优化与控制
摘要
主动学习(AL)在标注训练数据成本高昂的各个应用领域引起了广泛关注。AL为从业者提供了一个框架,帮助其向标注器(标注专家)查询信息性样本进行标注。然而,这些标签往往因标注者准确性的差异而包含噪声。此外,不确定样本由于其复杂性更容易收到错误标签。从不完美标签数据中学习会导致不准确的分类器。我们提出了一种新的AL框架,通过最小化噪声水平来构建鲁棒的分类模型。我们的方法包括一个分配模型,最优地将查询点分配给标注者,旨在最小化每个循环内的最大可能噪声。此外,我们引入了一种新的采样方法来识别最佳查询点,减少标签噪声对分类器性能的影响。我们的实验表明,我们的方法与几种基准方法相比显著提升了分类性能。
引用
@article{arxiv.2512.12870,
title = {Optimal Labeler Assignment and Sampling for Active Learning in the Presence of Imperfect Labels},
author = {Pouya Ahadi and Blair Winograd and Camille Zaug and Karunesh Arora and Lijun Wang and Kamran Paynabar},
journal= {arXiv preprint arXiv:2512.12870},
year = {2025}
}
备注
22 pages, 6 figures. Preprint under review