中文

基于关键点感知的遮蔽图像建模

计算机视觉与模式识别 2025-01-03 v3 机器学习

摘要

SimMIM 是一种广泛用于基于遮蔽图像建模预训练视觉转换器的方法.然而,尽管其在微调性能方面取得了成功,但被证明在线性探索时性能次优.我们提出一种从关键点特征派生的高效 patch 级加权方法,它捕获局部信息,并在 SimMIM 的重构阶段提供更好的上下文.我们的方法,KAMIM,在 ImageNet-1K 数据集上使用 ViT-B 时,将顶级 1 线性探测准确率从 16.12% 提升至 33.97%,微调准确率从 76.78% 提升至 77.3%,且在相同训练时数下完成.我们对不同数据集、关键点提取器和模型架构进行了广泛测试,观察到 patch 级加权能提升更大预训练数据集上的线性探测性能.我们还分析了使用 KAMIM 训练的 ViT-B 所学习的表示,发现其在行为上类似于对比学习,包括更长的注意距离以及跨层均匀的自注意力.我们的代码已公开于 https://github.com/madhava20217/KAMIM.

关键词

引用

@article{arxiv.2407.13873,
  title  = {Keypoint Aware Masked Image Modelling},
  author = {Madhava Krishna and A V Subramanyam},
  journal= {arXiv preprint arXiv:2407.13873},
  year   = {2025}
}

备注

Accepted to ICASSP 2025