中文

通过样本周围损失函数曲率审视记忆化

机器学习 2023-10-03 v2 人工智能

摘要

深度神经网络是过参数化的,并且容易过拟合其训练的数据集。在极端情况下,已证明这些网络可以记忆具有完全随机化标签的训练集。我们提出使用每个训练样本周围损失函数的曲率(在训练轮次上平均)作为该样本记忆化的度量。我们使用该指标研究流行图像数据集中不同样本的一般化与记忆化特性,并从定性与定量上表明其良好捕捉记忆化统计。我们首先展示高曲率样本在视觉上对应于长尾、错标或冲突样本,即最可能被记忆的那些。该分析帮助我们发现了(据我们所知)CIFAR100与ImageNet数据集上一种新颖的失败模式:具有不同标签的重复图像。在定量上,我们通过两种方法佐证分数的有效性。首先,我们通过展示与Feldman和Zhang(2020)发布的记忆化分数具有高余弦相似度,针对一个独立且全面计算的基线验证我们的分数。其次,我们注入被网络记忆的损坏样本,并展示这些样本以高曲率被学习。为此,我们合成地错标数据集的随机子集。我们将网络过拟合于它,并展示按曲率排序在识别损坏样本上产生高AUROC值。我们方法的附加优势是可扩展,因为它仅需训练单个网络,而非基线训练的数千个,同时捕捉基线未能识别的上述失败模式。

关键词

引用

@article{arxiv.2307.05831,
  title  = {Memorization Through the Lens of Curvature of Loss Function Around Samples},
  author = {Isha Garg and Deepak Ravikumar and Kaushik Roy},
  journal= {arXiv preprint arXiv:2307.05831},
  year   = {2023}
}

备注

Preprint