中文

用于不变自监督学习的软等变正则化

计算机视觉与模式识别 2026-03-10 v1 机器学习

摘要

自监督学习(SSL)通常学习针对语义保持数据增广的不变表示。虽然对识别任务有效,但强制不变性可能会抑制对几何扰动和空间敏感迁移有用的依赖性结构。因此,越来越多的工作尝试将不变性基于的 SSL 与等变目标相结合,但这些目标通常施加在相同的最终表示上。在此设置下,我们观察到一种权衡:将等变正则化推向更深的层次会提高等变得分,但会降低 ImageNet-1k 线性评估性能,这激励了一种层级解耦设计。基于此权衡,我们提出软等变正则化(SER),一种可插入的正则器,通过在中间空间标记图上软性鼓励等变性来实现层级解耦:我们保持 base SSL 目标在最终嵌入上的不变性,而通过在特征空间中直接应用分析指定的群作用 ρg\rho_g,软性鼓励中间空间标记图的等变性。SER 不学习/预测任何 per-sample 转换代码/标签,无需额外的转换预测头,仅增加 1.008 倍的训练 FLOPs。在 ImageNet-1k ViT-S/16 预训练中,SER 在严格匹配的 2-view 设置下将 MoCo-v3 提升 +0.84 Top-1 线性评估,并在 DINO 和 Barlow Twins 上持续提升;在匹配视图计数下,SER 在比较的不变性+等变性添加方法中实现 ImageNet-1k 线性评估最佳 Top-1。SER 还在 ImageNet-C/P 上提升 +1.11/+1.22 Top-1,在冻结主干的 COCO 检测中提升 +1.7 mAP。最后,将相同的层级解耦方案应用于现有的不变性+等变性基线方法后,仍能提升其准确率,表明层级解耦是组合不变性与等变性的通用设计原则。

关键词

引用

@article{arxiv.2603.06693,
  title  = {Soft Equivariance Regularization for Invariant Self-Supervised Learning},
  author = {Joohyung Lee and Changhun Kim and Hyunsu Kim and Kwanhyung Lee and Juho Lee},
  journal= {arXiv preprint arXiv:2603.06693},
  year   = {2026}
}

备注

14th International Conference on Learning Representations (ICLR 2026)