VORTEX: Challenging CNNs at Texture Recognition by using Vision Transformers with Orderless and Randomized Token Encodings
计算机视觉与模式识别
2025-03-11 v1 人工智能
机器学习
摘要
纹理识别最近被 ImageNet 预训练的深度卷积神经网络(CNNs)主导,需进行专门的修改和特征工程才能实现最佳性能。然而,尽管 Vision Transformer(ViT)于几年前被提出,但其纹理识别能力尚不为人知。为此,本文引入 VORTEX(ViTs with Orderless and Randomized Token Encodings for Texture Recognition),一种新方法,使其能够有效用于纹理分析。VORTEX 从预训练 ViT 主干网络中提取多深度 token 嵌入,并采用轻量级模块对层次特征进行聚合和无序编码,以获得更好的纹理识别任务图像表示。该方法允许与任何采用常见 Transformer 架构的 ViT 无缝集成。此外,不对主干进行微调,因为它们仅用作冻结特征提取器,特征被输入到线性 SVM。我们在九个多样化的纹理数据集上评估 VORTEX,展示了其在各种纹理分析场景中实现或超越最佳性能的能力。通过搭桥 CNN 与基于 Transformer 的架构之间的纹理识别差距,VORTEX 为采用新兴 Transformer 基础模型铺平了道路。此外,VORTEX 在与具有类似成本的 CNN 集成时表现出稳健的计算效率。该方法的实现与实验脚本均已在我们的在线仓库中公开。
引用
@article{arxiv.2503.06368,
title = {VORTEX: Challenging CNNs at Texture Recognition by using Vision Transformers with Orderless and Randomized Token Encodings},
author = {Leonardo Scabini and Kallil M. Zielinski and Emir Konuk and Ricardo T. Fares and Lucas C. Ribas and Kevin Smith and Odemir M. Bruno},
journal= {arXiv preprint arXiv:2503.06368},
year = {2025}
}