中文

Step-E:面向带噪标签的鲁棒学习的可微数据清洗框架

机器学习 2025-11-24 v1

摘要

野外收集的训练数据常包含噪声标签和异常值,这会显著降低深度神经网络的性能和可靠性。虽然数据清洁通常作为独立的预处理阶段应用,但这种两阶段管道既未充分利用下游模型的反馈,也无法适应未知的噪声模式。我们提出Step-E,一个简洁的框架,将样本选择和模型学习集成到单一的优化过程中。在每个 epoch 中,Step-E 按损失值对样本进行排序,逐步增加从梯度更新中排除高损失样本的比例,经过简短的 warm-up 阶段后,形成一种在线 curriculum,聚焦于易识别且一致的样本,最终忽略持续的异常值。在CIFAR-100N 上,Step-E 将ResNet-18 模型的测试准确率从43.3%(±0.7%)提升至50.4%(±0.9%),显著优于损失截断、自-paced 学习和一次性过滤技术,接近清洁标签的 oracle 60.5%(±0.2%)。在CIFAR-10N(aggre)上,Step-E 也超越了噪声基线(85.3% vs. 83.9%),仅通过适度的训练时间开销即可接近清洁标签的 oracle(85.9%)。

关键词

引用

@article{arxiv.2511.17040,
  title  = {Step-E: A Differentiable Data Cleaning Framework for Robust Learning with Noisy Labels},
  author = {Wenzhang Du},
  journal= {arXiv preprint arXiv:2511.17040},
  year   = {2025}
}

备注

12 pages, 4 figures