学习需要记忆吗?关于长尾的一个短故事
机器学习
2021-01-12 v4 机器学习
摘要
图像识别任务的最先进结果是通过使用(近乎)完美拟合训练集的过参数化学习算法实现的,并且已知这些算法甚至能很好地拟合随机标签。这种记忆训练数据标签的倾向无法用现有的理论分析来解释。当训练数据包含敏感个人信息时,对训练数据的记忆还会带来显著的隐私风险,因此理解这种记忆对于精确学习是否必要至关重要。我们为这一现象提供了首个概念性解释和理论模型。具体而言,我们证明,对于自然数据分布,记忆标签对于实现接近最优的泛化误差是必要的。至关重要的是,即使是异常值和噪声标签也需要被记忆。该模型受到近期多项实证工作结果的启发和支持。在我们的模型中,数据从子总体的混合中采样,我们的结果表明,每当子总体频率的分布是长尾分布时,记忆就是必要的。已知图像和文本数据是长尾分布的,因此我们的结果在这些实证现象之间建立了正式联系。我们的结果允许量化学习中限制记忆的成本,并解释了隐私保护和模型压缩对不同子群体产生的不同影响。
引用
@article{arxiv.1906.05271,
title = {Does Learning Require Memorization? A Short Tale about a Long Tail},
author = {Vitaly Feldman},
journal= {arXiv preprint arXiv:1906.05271},
year = {2021}
}
备注
Significant revision: revised introduction/overview; added formal treatment of noise in the labels and explanation for the disparate effects of limiting memorization