中文

深入样本损失曲线以应对噪声与不平衡数据

机器学习 2022-01-05 v1 人工智能 计算机视觉与模式识别

摘要

在实际收集的训练数据中常出现标签损坏与类别不平衡,这易导致深度神经网络(DNNs)过拟合。现有方法通过采用样本重加权策略缓解这些问题,即设计加权函数对样本重新加权。然而,其仅适用于仅含单一数据偏置类型的训练数据。但在实践中,带有损坏标签的长尾类偏置样本常共存于训练数据中。如何同时处理它们是一个关键但未被充分探索的问题。本文中,我们发现这两类偏置样本虽具有相似的瞬时损失,却在损失曲线中具有可区分的趋势与特征,这可为样本权重分配提供有价值的先验。受此启发,我们深入损失曲线并提出一种新颖的探测-分配训练策略:在探测阶段,我们在无干预下于整个偏置训练数据上训练网络,并将每个样本的损失曲线记录为附加属性;在分配阶段,我们将所得属性输入新设计的曲线感知网络 CurveNet,以通过元学习自适应识别各样本的偏置类型并分配适当权重。元学习的训练速度也阻碍了其应用。为此,我们提出跳过层元优化(SLMO)方法,通过跳过底层来加速训练速度。大量合成与真实实验充分验证了所提方法,其在多个挑战性基准上取得了最先进性能。

关键词

引用

@article{arxiv.2201.00849,
  title  = {Delving into Sample Loss Curve to Embrace Noisy and Imbalanced Data},
  author = {Shenwang Jiang and Jianan Li and Ying Wang and Bo Huang and Zhang Zhang and Tingfa Xu},
  journal= {arXiv preprint arXiv:2201.00849},
  year   = {2022}
}

备注

Accepted by AAAI-2022