中文

纹理分析中面向特征提取的 Vision Transformer 比较综述

计算机视觉与模式识别 2024-06-11 v1 机器学习

摘要

纹理是图像中重要的视觉属性,已在各种图像识别应用中受到广泛研究。卷积神经网络(CNNs)在许多计算机视觉任务中取得了成功,目前是最好的纹理分析方法之一。另一方面,Vision Transformer(ViTs)已在对象识别等任务中超越 CNN 的性能,引发了该领域的范式转变。然而,ViTs 迄今为止尚未针对纹理识别进行深度考察,阻碍了对其在这一特定setting 中的潜力的proper 评估。为此,本工作探讨了各种预训练 ViT 架构在依赖纹理的任务上的迁移效果。我们审阅了 21 种不同的 ViT 变体,并在多个任务上进行广泛评估和比较,包括评估其对纹理旋转、尺度和光照变化的鲁棒性,以及区分颜色纹理、材料纹理和纹理属性。目标是理解这些模型在直接应用于纹理识别时的潜力和差异,主要使用预训练 ViTs 进行特征提取,并采用线性分类器进行评估。我们还评估了其效率,这是与其他方法相比的一个主要缺点。我们的结果表明,ViTs 通常优于 CNN 和 hand-engineered 模型,尤其是在使用更强的预训练和涉及 in-the-wild 纹理(来自互联网的图像)的任务中。我们特别指出了以下有前景的模型:ViT-B 采用 DINO 预训练、BeiTv2 以及 Swin 架构,以及 EfficientFormer 作为低成本替代方案。就效率而言,尽管 ViT-B 和 BeiT(v2) 的 GFLOPs 和参数数量更高,但在 GPU 上实现的特征提取时间可低于 ResNet50。

关键词

引用

@article{arxiv.2406.06136,
  title  = {A Comparative Survey of Vision Transformers for Feature Extraction in Texture Analysis},
  author = {Leonardo Scabini and Andre Sacilotti and Kallil M. Zielinski and Lucas C. Ribas and Bernard De Baets and Odemir M. Bruno},
  journal= {arXiv preprint arXiv:2406.06136},
  year   = {2024}
}