基于 Patch-Mixup-ViT 的自适应宽高比车辆重识别
计算机视觉与模式识别
2024-11-12 v1
摘要
视觉 Transformer(ViT)在车辆重识别任务中展现了卓越性能。然而,图像或视频输入的非方形宽高比会对重识别准确率产生负面影响。为应对这一挑战,我们提出了一种新颖的、以人类感知为驱动的、通用的基于 ViT 的重识别框架,该框架融合了在不同宽高比上训练的模型。我们的主要贡献有三方面:(i)我们利用 VeRi-776 和 VehicleID 数据集分析了宽高比对性能的影响,为基于原始图像宽高比分布的输入设置提供了指导。(ii)我们在 ViT 分块过程中引入了基于空间注意力得分的分块级 mixup 策略,并实施了非均匀步长以更好地对齐目标宽高比。(iii)我们提出了一种动态特征融合重识别网络以增强模型鲁棒性。我们的方法在两个数据集上均优于最先进的基于 Transformer 的方法,且每张图像的推理时间仅有极小增加。
引用
@article{arxiv.2411.06297,
title = {Adaptive Aspect Ratios with Patch-Mixup-ViT-based Vehicle ReID},
author = {Mei Qiu and Lauren Ann Christopher and Stanley Chien and Lingxi Li},
journal= {arXiv preprint arXiv:2411.06297},
year = {2024}
}