中文

关于自监督学习中的泛化与因果解释

计算机视觉与模式识别 2024-10-02 v1 机器学习

摘要

自监督学习 (SSL) 方法从无标签数据中学习,能够在下游任务上实现高泛化性能。然而,它们也可能对训练数据过拟合,失去对新任务的适应能力。为调查这一现象,我们在 various SSL 方法和数据集上进行实验,并提出两个观察结果:(1) 在后期层和周期中发生快速过拟合,而泛化特征在所有周期的早期层中被学习;(2) 编码率降低可用于衡量 SSL 模型过拟合程度的指标。基于这些观察,我们提出了撤销记忆机制 (Undoing Memorization Mechanism, UMM),这是一种即插即用的方法,通过对齐早期和最后一层的特征分布,以最大化最后一层输出的编码率降低,从而减轻预训练特征提取器的过拟合。UMM 的学习过程是一个双层优化过程。我们对 UMM 进行因果分析,以解释 UMM 如何帮助预训练特征提取器克服过拟合并恢复泛化。我们还展示了 UMM 在各种下游任务上显著提高了 SSL 方法的泛化性能。

关键词

引用

@article{arxiv.2410.00772,
  title  = {On the Generalization and Causal Explanation in Self-Supervised Learning},
  author = {Wenwen Qiang and Zeen Song and Ziyin Gu and Jiangmeng Li and Changwen Zheng and Fuchun Sun and Hui Xiong},
  journal= {arXiv preprint arXiv:2410.00772},
  year   = {2024}
}