自监督学习中的记忆化提升下游泛化能力
机器学习
2024-06-19 v3
摘要
自监督学习(SSL)最近因其能够在纯无标签数据(通常从互联网抓取)上训练高性能编码器而受到广泛关注。这些数据仍然可能是敏感的,并且经验证据表明SSL编码器会记忆其训练数据的私有信息,并在推理时泄露。由于监督学习中现有的记忆化理论定义依赖于标签,它们无法迁移到SSL。为了解决这一差距,我们提出了SSLMem,一个在SSL中定义记忆化的框架。我们的定义比较了数据点及其增强视图在由训练过这些数据点的编码器和未训练过这些数据点的编码器返回的表征对齐上的差异。通过对不同编码器架构和数据集的全面实证分析,我们强调,尽管SSL依赖于大型数据集和强数据增强(这两者在监督学习中都是已知的减少过拟合的正则化技术),但仍有相当比例的训练数据点经历了高记忆化。通过我们的实证结果,我们表明这种记忆化对于编码器在不同下游任务上实现更高的泛化性能至关重要。
引用
@article{arxiv.2401.12233,
title = {Memorization in Self-Supervised Learning Improves Downstream Generalization},
author = {Wenhao Wang and Muhammad Ahmad Kaleem and Adam Dziedzic and Michael Backes and Nicolas Papernot and Franziska Boenisch},
journal= {arXiv preprint arXiv:2401.12233},
year = {2024}
}
备注
Accepted at ICLR 2024