中文

通过二次分割遗忘表征数据点

机器学习 2022-10-28 v1

摘要

研究样本难度的研究者越来越关注神经网络在整个训练过程中学习和遗忘样本的动态过程。从这些动态过程中衍生出的流行指标包括:(i) 样本首次被正确分类的轮次;(ii) 其预测在训练期间翻转的次数;以及 (iii) 如果样本被保留,其预测是否会翻转。然而,这些指标无法区分因不同原因而困难的样本,例如属于稀有子群体、被错误标记或属于复杂子群体。在本文中,我们提出了二次分割遗忘时间二次分割遗忘时间(SSFT),这是一个补充指标,用于追踪原始训练样本在网络于随机保留的数据分区上进行微调后被遗忘的轮次(如果有的话)。在多个基准数据集和模态上,我们证明被错误标记被错误标记的样本遗忘得很快,而看似稀有稀有的样本遗忘得相对较慢。相比之下,仅考虑第一次分割学习动态的指标难以区分这两者。在较大的学习率下,SSFT 往往对架构、优化器和随机种子具有鲁棒性。从实践角度来看,SSFT 可以 (i) 帮助识别错误标记的样本,移除这些样本可以提高泛化能力;(ii) 提供关于失败模式的见解。通过对过参数化线性模型的理论分析,我们为观察到的现象如何产生提供了见解。复现我们实验的代码可在此处找到:https://github.com/pratyushmaini/ssft。

关键词

引用

@article{arxiv.2210.15031,
  title  = {Characterizing Datapoints via Second-Split Forgetting},
  author = {Pratyush Maini and Saurabh Garg and Zachary C. Lipton and J. Zico Kolter},
  journal= {arXiv preprint arXiv:2210.15031},
  year   = {2022}
}

备注

Accepted at NeurIPS 2022