基于 Swin Transformer 的车标识别新方法
计算机视觉与模式识别
2024-01-30 v1
摘要
智能交通系统 (ITS) 利用传感器、摄像头和大数据分析来监控实时交通状况,旨在提高交通效率和安全性。在此过程中,准确的车辆识别至关重要,而车标识别 (VLR) 是一种关键方法。VLR 通过区分道路上的车辆来实现有效管理和监控。卷积神经网络 (CNN) 在 VLR 研究中取得了令人瞩目的进展。然而,要达到更高的性能需要大量的时间和计算资源进行训练。近年来,Transformer 模型的兴起为 VLR 带来了新的机遇。Swin Transformer 凭借其高效的计算和全局特征建模能力,在挑战性条件下优于 CNN。在本文中,我们使用 Swin Transformer 实现了实时 VLR,并对其进行了微调以获得最佳性能。在三个公开车标数据集(HFUT-VL1、XMU、CTGU-VLD)上进行的大量实验分别展示了令人印象深刻的最高准确率结果:99.28%、100% 和 99.17%。此外,迁移学习策略的使用使我们的方法能够与最先进的 VLR 方法相媲美。这些发现证实了我们的方法相对于现有方法的优越性。未来的研究可以探索和优化 Swin Transformer 在其他车辆视觉识别任务中的应用,以推动 ITS 的发展。
引用
@article{arxiv.2401.15458,
title = {A New Method for Vehicle Logo Recognition Based on Swin Transformer},
author = {Yang Li and Doudou Zhang and Jianli Xiao},
journal= {arXiv preprint arXiv:2401.15458},
year = {2024}
}