中文

视觉 Transformer 自监督学习机制综述

计算机视觉与模式识别 2025-08-26 v6 人工智能 机器学习

摘要

深度学习的进步正在重新定义机器处理和理解视觉数据的方式。视觉 Transformer (ViTs) 近期在计算机视觉相关任务中展现出卓越的性能。然而,其性能随标注数据数量的增加而提升,表明对标注数据存在依赖。人工标注数据难以获取,因此研究重点从传统标注转向学习数据内部结构的无监督学习策略。为应对这一挑战,自监督学习 (Self-Supervised Learning, SSL) 作为一种极具前景的技术应运而生。SSL 利用数据内的内在关系作为一种监督形式。该技术可以减少对手工标注的依赖,为模型训练提供更具可扩展性和资源高效性的方法。考虑到这些优势,有必要评估 SSL 方法与 ViTs 的结合,尤其是在标注数据有限的情况下。受这一发展趋势的启发,本综述旨在系统回顾专为 ViTs 定制的 SSL 机制。我们提出了一种全面的分类法,根据 SSL 技术的表示和预训练任务对其进行分类。此外,我们强调了研究 SSL 的动机,回顾了主要的预训练任务,并突出了该领域的进展与挑战。进一步地,我们对专为 ViTs 设计的各种 SSL 方法进行了比较分析,评估了它们的优势、局限性以及在不同场景下的适用性。

关键词

引用

@article{arxiv.2408.17059,
  title  = {A Survey of the Self Supervised Learning Mechanisms for Vision Transformers},
  author = {Asifullah Khan and Anabia Sohail and Mustansar Fiaz and Mehdi Hassan and Tariq Habib Afridi and Sibghat Ullah Marwat and Farzeen Munir and Safdar Ali and Hannan Naseem and Muhammad Zaigham Zaheer and Kamran Ali and Tangina Sultana and Ziaurrehman Tanoli and Naeem Akhter},
  journal= {arXiv preprint arXiv:2408.17059},
  year   = {2025}
}

备注

42 Pages, 4 Figures, 7 Tables