生成真实基准:用于软标签与标签噪声研究的合成数据
机器学习
2024-09-24 v2
摘要
在许多真实世界分类任务中,标签噪声是不可避免的问题,会对机器学习模型的泛化误差产生不利影响。此外,评估方法如何处理此类噪声十分复杂,因为若无干净标签,便无法准确量化标签噪声对其性能的影响。现有标签噪声研究通常依赖带噪或过度简化的模拟数据作为基线,并向其中注入具有已知特性的额外噪声。本文介绍SYNLABEL,一个通过创建由真实世界数据启发的无噪数据集来解决这些局限的框架。SYNLABEL支持将预指定或学习得到的函数定义为真实基准函数,并用于生成新的干净标签。此外,通过在函数定义域内对选定特征的值反复重采样、评估函数并聚合所得标签,可为每个数据点分配软标签或标签分布。这些分布捕捉了许多真实数据集中固有的不确定性,并支持标签噪声的直接注入与量化。所生成的数据集作为复杂度可调的干净基线,可向其引入各类噪声。此外,它们促进了软标签学习及相关应用的研究。我们展示了SYNLABEL的应用,证明其精确量化标签噪声的能力及对现有方法的改进。
引用
@article{arxiv.2309.04318,
title = {Generating the Ground Truth: Synthetic Data for Soft Label and Label Noise Research},
author = {Sjoerd de Vries and Dirk Thierens},
journal= {arXiv preprint arXiv:2309.04318},
year = {2024}
}
备注
Major update to the previous version, including the addition of Section 6: Uncertainty by Feature Hiding