中文

现代计算机视觉的基础与模型:关键架构中的关键构建模块

计算机视觉与模式识别 2025-09-05 v2

摘要

本报告通过考察六篇具有影响力的论文,分析了计算机视觉中关键设计模式的演变。分析从图像识别的基础架构开始。我们审阅了 ResNet,它引入残差连接以克服梯度消失问题,使更深的卷积网络能够有效训练。随后,我们检阅了 Vision Transformer (ViT),它通过将 Transformer 架构应用于图像块的序列,建立了新的范式,证明了基于注意力的模型在大规模图像识别中的有效性。在这些视觉表示 backbone 基础上,我们检查生成模型。GAN 的分析侧重其新颖的对抗训练过程,该过程通过对抗判别器挑战生成器,从而学习复杂的数据分布。然后,涵盖了潜在扩散模型 (LDMs),后者通过在感知压缩的潜在空间中进行顺序去噪过程来改进先前方法。LDMs 实现了高保真合成,同时具有更高的计算效率,代表了当前图像生成的状态-of-the-art。最后,我们探讨了自监督学习技术,这些技术减少了对标记数据的依赖。DINO 是一种自蒸馏框架,其中学生网络学习匹配由动量更新教师的输出,产生具有强 k-最近邻分类性能的特征。我们以掩码自编码器 (MAE) 结束,后者利用非对称编码器-解码器设计来重建被大量掩码的输入,为大规模视觉模型的预训练提供了高度可扩展且高效的方法。

关键词

引用

@article{arxiv.2507.23357,
  title  = {Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures},
  author = {Radu-Andrei Bourceanu and Neil De La Fuente and Jan Grimm and Andrei Jardan and Andriy Manucharyan and Cornelius Weiss and Daniel Cremers and Roman Pflugfelder},
  journal= {arXiv preprint arXiv:2507.23357},
  year   = {2025}
}