用于质疑训练数据可靠性的 Ghost Loss
计算机视觉与模式识别
2021-09-06 v1
摘要
监督式图像分类问题依赖于被假定已正确标注的训练数据;这一假设支撑着深度学习领域大多数工作。因此,在网络训练期间,网络被迫匹配标注者提供的标签,且未被赋予对其可能检测到的不一致之处选择替代方案的灵活性。因此,错误标注的训练图像可能最终在其实际不属于的类别中被“正确”分类。这可能降低网络性能,从而促使人们在甚至未检查训练数据质量的情况下构建更复杂的网络。本工作中,我们质疑标注数据集的可靠性。为此,我们引入 ghost loss(幻影损失)的概念,它可视为一种规则损失,以确定性方式对部分预测值置零,并允许网络选择给定标签的替代方案而不受惩罚。在概念验证实验后,我们利用 ghost loss 原理在知名训练数据集(MNIST、Fashion-MNIST、SVHN、CIFAR10)中检测混淆图像与错误标注图像,并提供了一种称为 sanity matrix(可靠性矩阵)的新工具来汇总这些混淆。
引用
@article{arxiv.2109.01504,
title = {Ghost Loss to Question the Reliability of Training Data},
author = {Adrien Deliège and Anthony Cioppa and Marc Van Droogenbroeck},
journal= {arXiv preprint arXiv:2109.01504},
year = {2021}
}
备注
This is the authors' preprint version of a paper published in IEEE Access in 2020. Please cite it as follows: A. Deli\`ege, A. Cioppa and M. Van Droogenbroeck, "Ghost Loss to Question the Reliability of Training Data", in IEEE Access, vol. 8, pp. 44774-44782, 2020, doi: 10.1109/ACCESS.2020.2978283