中文

AAformer:用于行人重识别的自动对齐 Transformer

计算机视觉与模式识别 2024-06-26 v3

摘要

在行人重识别(re-ID)中,从行人图像中提取部件级特征已被证实对提供细粒度信息至关重要。现有多数基于 CNN 的方法仅能粗略定位人体部件,或依赖预训练的人体解析模型并无法定位可辨识的非人体部件(如背包)。本文首次在 Transformer 架构中引入对齐方案,并提出自动对齐 Transformer(AAformer)以在块(patch)级别自动定位人体与非人体部件。我们引入了“部件令牌([PART]s)”,即可学习向量,用于在 Transformer 中提取部件特征。一个 [PART] 仅在自注意力中与局部的图像块子集交互,并学习成为该部件表示。为自适应地将图像块分组为不同子集,我们设计了自动对齐。自动对齐采用最优传输(OT)算法的一种快速变体,以 [PART]s 为原型在线将块嵌入聚类为若干组。AAformer 将部件对齐集成于自注意力中,输出的 [PART]s 可直接用作检索的部件特征。大量实验验证了 [PART]s 的有效性以及 AAformer 相对于多种最先进方法的优越性。

关键词

引用

@article{arxiv.2104.00921,
  title  = {AAformer: Auto-Aligned Transformer for Person Re-Identification},
  author = {Kuan Zhu and Haiyun Guo and Shiliang Zhang and Yaowei Wang and Jing Liu and Jinqiao Wang and Ming Tang},
  journal= {arXiv preprint arXiv:2104.00921},
  year   = {2024}
}

备注

Accepted by TNNLS. IEEE Transactions on Neural Networks and Learning Systems (2023)