Vision Transformer 与 CNN 在少样本刚性变换和基准矩阵估计中的比较研究
计算机视觉与模式识别
2025-10-07 v1
摘要
Vision Transformer (ViT) 和大规模卷积神经网络 (CNN) 通过预训练特征表示重塑了计算机视觉领域,这些表示通过迁移学习为各种任务提供了强大的性能。然而,这些方法在面对数据有限的几何估计任务时作为 backbone 架构的效率仍是未决问题。本工作关注两种此类任务:1) 估计成对图像之间的 2D 刚性变换,2) 为立体图像对预测基准矩阵,这是一项在自动驾驶、机器人和 3D 场景重建等多个应用中重要的问题。针对这个引人入胜的问题,本工作系统性地比较了大规模 CNN (ResNet、EfficientNet、CLIP-ResNet) 与 ViT 基础模型 (CLIP-ViT 变体和 DINO),在各种数据规模设置下,包括少样本场景。这些预训练模型被优化用于分类或对比学习,鼓励其主要关注高层语义。所考虑的任务需要在局部特征和全局特征之间进行不同程度的平衡,这挑战了将这些模型直接用作 backbone 的简单做法。经验性比较结果显示,在大规模下游数据场景中进行细化时,ViT 的性能类似于从头训练;然而,在小数据场景下,CNN 的归纳偏置和较小容量提高了其性能,使其能够匹配 ViT 的性能。此外,ViT 在跨域评估中表现出更强的泛化能力,其中数据分布发生变化。这些结果凸显了在细化阶段仔细选择模型架构的重要性,激励未来研究发展能够平衡局部和全局表示的混合架构。
引用
@article{arxiv.2510.04794,
title = {A Comparative Study of Vision Transformers and CNNs for Few-Shot Rigid Transformation and Fundamental Matrix Estimation},
author = {Alon Kaya and Igal Bilik and Inna Stainvas},
journal= {arXiv preprint arXiv:2510.04794},
year = {2025}
}