面向目标重识别的 Transformer:综述
计算机视觉与模式识别
2024-10-23 v2 人工智能
摘要
目标重识别(Re-ID)旨在跨不同时间和场景识别特定目标,是计算机视觉中一项被广泛研究的任务。长期以来,该领域主要由基于卷积神经网络的深度学习技术驱动。近年来,视觉 Transformer 的出现激发了越来越多研究深入探索基于 Transformer 的重识别方法,不断刷新性能记录,见证了 Re-ID 领域的重大进展。Transformer 提供了一种强大、灵活且统一的解决方案,以无与伦比的效能满足了广泛的 Re-ID 任务需求。本文对基于 Transformer 的 Re-ID 进行了全面回顾与深入分析。我们将现有工作分类为基于图像/视频的 Re-ID、有限数据/标注下的 Re-ID、跨模态 Re-ID 以及特殊 Re-ID 场景,并深入阐述了 Transformer 在应对这些领域众多挑战时所展现的优势。考虑到无监督 Re-ID 的趋势,我们提出了一个新的 Transformer 基线模型 UntransReID,在单模态和跨模态任务上均达到了最先进的性能。针对探索不足的动物 Re-ID,我们设计了一个标准化的实验基准并进行了大量实验,以探索 Transformer 在此任务中的适用性并促进未来研究。最后,我们讨论了在大基础模型时代一些重要但尚未充分研究的开放性问题,相信这将作为该领域研究人员的一本新手册。一个定期更新的网站将在 https://github.com/mangye16/ReID-Survey 提供。
引用
@article{arxiv.2401.06960,
title = {Transformer for Object Re-Identification: A Survey},
author = {Mang Ye and Shuoyi Chen and Chenyue Li and Wei-Shi Zheng and David Crandall and Bo Du},
journal= {arXiv preprint arXiv:2401.06960},
year = {2024}
}
备注
Accepted by International Journal of Computer Vision (IJCV) in October 2024