你无法处理(污垢)真相:数据中心视角改进伪标签
机器学习
2024-06-21 v1 人工智能
摘要
伪标签是半监督学习中一种流行的技术,用于在标记样本稀缺时利用未标记数据。伪标签的生成与选择高度依赖标记数据。现有方法隐含地假设标记数据为黄金标准且'完美',但现实中可能因误标或模糊性等问题而被违背。我们针对这一被忽视的方面展开研究,表明调查标记数据质量对改进任何伪标签方法具有重要意义。具体而言,我们引入一种新颖的数据特征描述与选择框架,称为DIPS,以扩展伪标签技术。我们通过分析学习动力学,选取有用的标记样本与伪标记样本。我们在广泛的真实世界表格数据集和图像数据集上,展示了DIPS适用于各种伪标签方法且具有实际影响。此外,DIPS提高了数据效率,并缩小了不同伪标签器之间的性能差距。总体而言,我们强调在现实场景中,对伪标签进行数据中心重新思考的显著益处。
引用
@article{arxiv.2406.13733,
title = {You can't handle the (dirty) truth: Data-centric insights improve pseudo-labeling},
author = {Nabeel Seedat and Nicolas Huynh and Fergus Imrie and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2406.13733},
year = {2024}
}
备注
Published in the Journal of Data-centric Machine Learning Research (DMLR) *Seedat & Huynh contributed equally