视觉 Transformer 在目标识别与检测中的实用评估
计算机视觉与模式识别
2025-12-11 v1 人工智能
摘要
卷积神经网络(CNNs)在计算机视觉中有时在理解图像全局语境方面存在挑战,因为它们主要关注局部模式。而受语言处理模型启发的视觉 Transformer(ViTs)通过自注意力机制,能够理解整个图像中的关系。本文比较了不同类型的 ViTs(纯 Transformer、层次结构 Transformer 和混合 Transformer)与传统 CNN 模型在 various 任务上的表现,包括目标识别、检测和医学图像分类。我们在 ImageNet 等标准数据集上进行了充分的测试,用于图像分类;在 COCO 数据集上进行测试,用于目标检测。此外,我们将这些模型应用于医学成像,使用 ChestX-ray14 数据集。我们发现,混合 Transformer 和层次结构 Transformer,尤其是 Swin 和 CvT,在准确率和计算资源之间提供了强大的平衡。此外,通过对医学图像进行数据增强技术实验,我们发现尤其是使用 Swin Transformer 模型时,性能得到了显著提升。总体而言,我们的结果表明,视觉 Transformer 在许多情况下都能与传统 CNN 竞争,尤其是在需要理解全局视觉语境的场景中表现更好,如医学成像领域。
引用
@article{arxiv.2512.09579,
title = {Hands-on Evaluation of Visual Transformers for Object Recognition and Detection},
author = {Dimitrios N. Vlachogiannis and Dimitrios A. Koutsomitropoulos},
journal= {arXiv preprint arXiv:2512.09579},
year = {2025}
}