面向复杂监控场景中遮挡行人重识别的 Vision Transformer
计算机视觉与模式识别
2025-11-03 v1
摘要
监控场景下的行人重识别(ReID)面临遮挡、视角畸变和图像质量差的问题。大多数现有方法依赖复杂模块,或仅在清晰正面图像上表现良好。我们提出了 Sh-ViT(Shuffling Vision Transformer),一个轻量且鲁健的遮挡行人 ReID 模型。基于 ViT-Base,Sh-ViT 引入了三个组件:首先,在最终 Transformer 层中引入 Shuffle 模块,以打破空间相关性并增强对遮挡和模糊的鲁健性;其次,采用场景适应性数据增强(几何变换、擦除、模糊和颜色调整),以模拟监控条件;最后,采用 DeiT 基础的知识蒸馏以提高有限标签下的学习效果。为支持实际应用评估,我们构建了 MyTT 数据集,包含超过 10,000 名行人和 30,000+ 张图像来自基站检查,伴随频繁设备遮挡和摄像机变异。实验表明,Sh-ViT 在 MyTT 上实现了 83.2% 的 Rank-1 和 80.1% 的 mAP,在 Market1501 上分别达到 94.6% 的 Rank-1 和 87.5% 的 mAP,超越 CNN 和 ViT 基线,以及最新方法。在总结方面,Sh-ViT 在无需外部模块的情况下提升了对遮挡和模糊的鲁健性,为基于监控的人员监控提供了实用解决方案。
关键词
引用
@article{arxiv.2510.27677,
title = {Vision Transformer for Robust Occluded Person Reidentification in Complex Surveillance Scenes},
author = {Bo Li and Duyuan Zheng and Xinyang Liu and Qingwen Li and Hong Li and Hongyan Cui and Ge Gao and Chen Liu},
journal= {arXiv preprint arXiv:2510.27677},
year = {2025}
}
备注
12 pages,conference