SINDER: 修复DINOv2的奇异缺陷
计算机视觉与模式识别
2024-07-25 v1
摘要
在大规模数据集上训练的视觉Transformer模型虽然有效,但其提取的块标记(patch token)常常表现出伪影。虽然可以通过使用额外的分类标记重新训练整个模型来缓解此类缺陷,但这些标记存在的根本原因仍不清楚。在本文中,我们结合理论分析与实验观察,对这一现象进行了深入研究。我们的发现表明,这些伪影源于预训练网络本身,具体源自网络权重的左主导奇异向量。此外,为了减轻这些缺陷,我们提出了一种新颖的微调平滑正则化方法,仅使用小数据集即可修正结构缺陷,从而避免了完全重新训练的需要。我们在包括无监督分割、分类、有监督分割和深度估计在内的各种下游任务上验证了我们的方法,证明了其在提升模型性能方面的有效性。代码和检查点可在 https://github.com/haoqiwang/sinder 获取。
引用
@article{arxiv.2407.16826,
title = {SINDER: Repairing the Singular Defects of DINOv2},
author = {Haoqi Wang and Tong Zhang and Mathieu Salzmann},
journal= {arXiv preprint arXiv:2407.16826},
year = {2024}
}
备注
ECCV 2024