中文

摆脱降噪器:来自数据课程的自监督学习中的噪声鲁棒性涌现

计算机视觉与模式识别 2025-10-31 v2 人工智能 机器学习

摘要

自监督学习(SSL)已成为从无标签数据中提取丰富表征的强大方法。然而,SSL研究主要聚焦于干净、精选和高质量的数据集,导致应用于噪声数据的SSL仍然是一个挑战,这对于天文学、医学成像、地球物理学或金融等应用至关重要。本文提出了一个完全自监督的框架,使其能够在无需在推理或下游微调中使用降噪器的情况下实现噪声鲁棒表征学习。该方法首先在噪声数据上训练SSL降噪器,然后使用它来构建降噪到噪声数据课程(即先在降噪样本上训练,再在噪声样本上训练)以预训练SSL backbone(例如DINOv2),结合teacher-guided 正则化,将噪声嵌入锚定到其降噪对应物。该过程鼓励模型内化噪声鲁棒性。值得注意的是,降噪器可以在预训练后被丢弃,以简化部署。在ImageNet-1k上使用ViT-B,在极端高斯噪声(σ=255,信噪比=0.72 dB)下,我们的方法在DINOv2基础上提高了4.8个百分点的线性探测准确率,表明无降噪器的鲁棒性可以从噪声感知的预训练中涌现。代码可在https://github.com/wenquanlu/noisy_dinov2 获取。

关键词

引用

@article{arxiv.2505.12191,
  title  = {Ditch the Denoiser: Emergence of Noise Robustness in Self-Supervised Learning from Data Curriculum},
  author = {Wenquan Lu and Jiaqi Zhang and Hugues Van Assel and Randall Balestriero},
  journal= {arXiv preprint arXiv:2505.12191},
  year   = {2025}
}

备注

NeurIPS 2025