通过裁剪模型预测缓解对噪声标签的过拟合
机器学习
2023-06-14 v3 人工智能
摘要
在存在噪声标签的情况下,设计鲁棒损失函数对于保障深度神经网络的泛化性能至关重要。交叉熵(CE)损失因其无界性已被证明对噪声标签不鲁棒。为缓解该问题,现有工作通常设计具有对称性条件的专用鲁棒损失,但这往往导致欠拟合问题。本文的核心思想是在 logit 层级引入损失界,从而普遍提升现有损失的噪声鲁棒性。具体而言,我们提出 logit 裁剪(LogitClip),其将 logit 向量的范数钳制以确保其上界为常数。如此,配备我们 LogitClip 方法的 CE 损失被有效有界,从而缓解对带噪声标签样本的过拟合。此外,我们给出理论分析以证明 LogitClip 的容噪能力。大量实验表明,LogitClip 不仅显著提升 CE 损失的噪声鲁棒性,还广泛增强常用鲁棒损失的泛化性能。
引用
@article{arxiv.2212.04055,
title = {Mitigating Memorization of Noisy Labels by Clipping the Model Prediction},
author = {Hongxin Wei and Huiping Zhuang and Renchunzi Xie and Lei Feng and Gang Niu and Bo An and Yixuan Li},
journal= {arXiv preprint arXiv:2212.04055},
year = {2023}
}
备注
Accepted by ICML 2023