用于遮挡行人重识别的动态分块感知增强 Transformer
计算机视觉与模式识别
2024-02-19 v1
摘要
行人重识别(re-ID)仍然是一个重大挑战,特别是在涉及遮挡的场景中。以往解决遮挡问题的方法主要集中在利用外部语义线索对齐物理身体特征。然而,这些方法往往很复杂且易受噪声影响。为了解决上述挑战,我们提出了一种创新的端到端解决方案,称为动态分块感知增强 Transformer (DPEFormer)。该模型能够自动且动态地将人体信息与遮挡区分开来,无需外部检测器或精确的图像对齐。具体而言,我们引入了一个动态分块 token 选择模块 (DPSM)。DPSM 利用标签引导的代理 token 作为中介来识别信息丰富的无遮挡 token。然后选择这些 token 来推导后续的局部部位特征。为了促进全局分类特征与 DPSM 选择的精细局部特征的无缝整合,我们引入了一种新颖的特征混合模块 (FBM)。FBM 通过信息的互补性和部位多样性的利用来增强特征表示。此外,为了确保 DPSM 和整个 DPEFormer 能够仅使用身份标签进行有效学习,我们还提出了一种逼真遮挡增强 (ROA) 策略。该策略利用了 Segment Anything Model (SAM) 的最新进展。因此,它生成了与真实世界遮挡非常相似的遮挡图像,极大地增强了后续的对比学习过程。在遮挡和整体 re-ID 基准上的实验表明,DPEFormer 相较于现有的 SOTA 方法取得了显著进步。代码将公开发布。
关键词
引用
@article{arxiv.2402.10435,
title = {Dynamic Patch-aware Enrichment Transformer for Occluded Person Re-Identification},
author = {Xin Zhang and Keren Fu and Qijun Zhao},
journal= {arXiv preprint arXiv:2402.10435},
year = {2024}
}
备注
12 pages, 6 figures