中文

NFormer:基于邻域 Transformer 的鲁棒行人重识别

计算机视觉与模式识别 2022-04-21 v1 人工智能

摘要

行人重识别旨在跨不同相机与场景检索处于高度变化环境中的行人,其中鲁棒且具判别力的表征学习至关重要。多数研究考虑从单幅图像学习表征,忽略了图像间任何潜在的相互作用。然而,由于身份内差异大,忽略此类相互作用通常导致离群特征。为解决该问题,我们提出邻域 Transformer 网络,即 NFormer,其显式建模所有输入图像间的相互作用,从而抑制离群特征并总体上得到更鲁棒的表征。由于对海量图像建模相互作用是一项伴随大量干扰项的繁重任务,NFormer 引入两个新颖模块:地标智能体注意力(Landmark Agent Attention)与互逆邻域 Softmax(Reciprocal Neighbor Softmax)。具体而言,地标智能体注意力通过特征空间中少量地标的低秩分解高效建模图像间关系图。此外,互逆邻域 Softmax 仅对相关的而非全部邻域实现稀疏注意力,这减轻了无关表征的干扰并进一步缓解计算负担。在四个大规模数据集上的实验中,NFormer 达到了新的最先进水平(state-of-the-art)。代码发布于 \url{https://github.com/haochenheheda/NFormer}。

关键词

引用

@article{arxiv.2204.09331,
  title  = {NFormer: Robust Person Re-identification with Neighbor Transformer},
  author = {Haochen Wang and Jiayi Shen and Yongtuo Liu and Yan Gao and Efstratios Gavves},
  journal= {arXiv preprint arXiv:2204.09331},
  year   = {2022}
}

备注

8 pages, 7 figures, CVPR2022 poster