CMTR:用于可见光-红外行人重识别的跨模态 Transformer
计算机视觉与模式识别
2023-05-24 v1
摘要
可见光-红外跨模态行人重识别是一项具有挑战性的 ReID 任务,旨在检索和匹配异构可见光与红外模态之间同一身份的图像。因此,该任务的核心是弥合这两种模态之间的巨大鸿沟。现有的基于卷积神经网络的方法主要面临对模态信息感知不足的问题,并且无法为身份学习到良好的判别性模态不变嵌入,这限制了它们的性能。为了解决这些问题,我们提出了一种基于跨模态 Transformer 的方法(CMTR)用于可见光-红外行人重识别任务,该方法能够显式挖掘每种模态的信息,并基于此生成更好的判别性特征。具体而言,为了捕获模态特征,我们设计了新颖的模态嵌入,将其与 token 嵌入融合以编码模态信息。此外,为了增强模态嵌入的表示并调整匹配嵌入的分布,我们基于学习到的模态信息提出了一种模态感知增强损失,以减小类内距离并增大类间距离。据我们所知,这是将 Transformer 网络应用于跨模态重识别任务的首个工作。我们在公开的 SYSU-MM01 和 RegDB 数据集上进行了大量实验,我们提出的 CMTR 模型的性能显著超越了现有优秀的基于 CNN 的方法。
引用
@article{arxiv.2110.08994,
title = {CMTR: Cross-modality Transformer for Visible-infrared Person Re-identification},
author = {Tengfei Liang and Yi Jin and Yajun Gao and Wu Liu and Songhe Feng and Tao Wang and Yidong Li},
journal= {arXiv preprint arXiv:2110.08994},
year = {2023}
}
备注
11 pages, 7 figures, 7 tables