在存在误标数据情况下提升深度故障检测模型的泛化能力
机器学习
2021-11-24 v1 机器学习
摘要
误标样本在真实世界数据集中无处不在,因为基于规则的或专家的标注通常基于错误假设或受偏倚意见影响。神经网络可“记忆”这些误标样本,并因此表现出较差的泛化能力。这在故障检测应用中构成一个关键问题,其中不仅训练集,而且验证集都易于包含误标样本。在本工作中,我们提出一种用于含标签噪声鲁棒训练的新颖两步框架。第一步,我们基于假设空间中的更新来识别离群点(包括误标样本)。第二步,我们提出基于已识别离群点与一种数据增强技术来修改训练数据的不同方法。与先前方法相反,我们旨在寻找适用于真实世界应用(如故障检测,其中无干净的、“无噪声”验证集可用)的鲁棒解。在关于标签噪声上限的近似假设下,我们显著提升了在大量标签噪声下训练的模型的泛化能力。
引用
@article{arxiv.2009.14606,
title = {Improving Generalization of Deep Fault Detection Models in the Presence of Mislabeled Data},
author = {Katharina Rombach and Gabriel Michau and Olga Fink},
journal= {arXiv preprint arXiv:2009.14606},
year = {2021}
}
备注
12 pages, 3 figures, 5 tables