基于 Transformer 隐式学习解耦表征的遮挡行人重识别
计算机视觉与模式识别
2021-07-07 v1
摘要
各类遮挡下的行人重识别(re-ID)一直是一项长期挑战,因为带有不同类型遮挡的行人图像在图像匹配与排序中常面临错位问题。现有多数方法依据外部语义线索或特征相似度对齐身体部位的空间特征,但这种对齐方式复杂且对噪声敏感。我们设计了 DRL-Net,一种解耦表征学习网络,可在无需严格行人图像对齐或任何额外监督的情况下处理遮挡重识别。借助 transformer 架构,DRL-Net 通过对遮挡行人图像的局部特征进行全局推理,实现无对齐的重识别。它在 transformer 中语义偏好对象查询的引导下,通过自动解耦未定义语义成分(如人体部位或障碍物)的表征来衡量图像相似度。此外,我们在 transformer 解码器中设计了解相关约束,并将其施加于对象查询上,以更好地聚焦于不同语义成分。为更好地消除遮挡干扰,我们设计了一种对比特征学习技术(CFL),以更好地分离遮挡特征与判别性 ID 特征。在遮挡与整体重识别基准(Occluded-DukeMTMC、Market1501 和 DukeMTMC)上的大量实验表明,DRL-Net 始终取得优越的重识别性能,并在 Occluded-DukeMTMC 上大幅超越当前最优(state-of-the-art)方法。
引用
@article{arxiv.2107.02380,
title = {Learning Disentangled Representation Implicitly via Transformer for Occluded Person Re-Identification},
author = {Mengxi Jia and Xinhua Cheng and Shijian Lu and Jian Zhang},
journal= {arXiv preprint arXiv:2107.02380},
year = {2021}
}