密集自监督学习的 patch 级核对齐
计算机视觉与模式识别
2025-10-03 v2
摘要
密集自监督学习 (SSL) 方法在增强视觉模型的细粒度语义理解方面显示出有效性。然而,现有方法常依赖参数假设或复杂后处理(如聚类、排序),限制了其灵活性和稳定性。为克服这些限制,我们引入 patch 级核对齐 (PaKA),一种非参数、基于核的方法,通过后训练提高预训练视觉编码器的密集表示。我们提出一种稳健且有效的对齐目标,捕捉高维密集特征分布内在结构的统计依赖性。此外,我们重访继承自图像级 SSL 的数据增强策略,并为密集 SSL 提出改进后的数据增强策略。该框架通过在预训练模型之上进行轻量级后训练来提高密集表示。仅需 14 小时单 GPU 额外训练,本方法在广泛的密集视觉基准上实现了最先进的性能,显示出高效与有效性。
引用
@article{arxiv.2509.05606,
title = {Patch-Level Kernel Alignment for Dense Self-Supervised Learning},
author = {Juan Yeo and Ijun Jang and Taesup Kim},
journal= {arXiv preprint arXiv:2509.05606},
year = {2025}
}