中文

DRFormer:一种双正则化双向 Transformer 用于人员重识别

计算机视觉与模式识别 2026-02-03 v1 多媒体

摘要

细粒度判别细节与全局语义特征都可为解决人员重识别挑战(如遮挡和姿态变化)贡献。视觉基础模型(如 DINO)擅长挖掘局部纹理,视觉语言模型(如 CLIP)能够捕获强大的全局语义差异。现有方法主要依赖单一范式,忽视其整合潜在益处。在本文中,我们分析了这两种架构的互补作用,并提出一种框架通过一种\textbf{D}ual-\textbf{R}egularized Bidirectional \textbf{Transformer}(\textbf{DRFormer})来协同其优势。双正则化机制确保特征提取的多样性,实现两者贡献的更好平衡。广泛的实验表明,该方法有效地调和了局部和全局表征,相较于最新方法实现了竞争性能。

关键词

引用

@article{arxiv.2602.01059,
  title  = {DRFormer: A Dual-Regularized Bidirectional Transformer for Person Re-identification},
  author = {Ying Shu and Pujian Zhan and Huiqi Yang and Hehe Fan and Youfang Lin and Kai Lv},
  journal= {arXiv preprint arXiv:2602.01059},
  year   = {2026}
}