DRFormer:一种双正则化双向 Transformer 用于人员重识别
计算机视觉与模式识别
2026-02-03 v1 多媒体
摘要
细粒度判别细节与全局语义特征都可为解决人员重识别挑战(如遮挡和姿态变化)贡献。视觉基础模型(如 DINO)擅长挖掘局部纹理,视觉语言模型(如 CLIP)能够捕获强大的全局语义差异。现有方法主要依赖单一范式,忽视其整合潜在益处。在本文中,我们分析了这两种架构的互补作用,并提出一种框架通过一种\textbf{D}ual-\textbf{R}egularized Bidirectional \textbf{Transformer}(\textbf{DRFormer})来协同其优势。双正则化机制确保特征提取的多样性,实现两者贡献的更好平衡。广泛的实验表明,该方法有效地调和了局部和全局表征,相较于最新方法实现了竞争性能。
引用
@article{arxiv.2602.01059,
title = {DRFormer: A Dual-Regularized Bidirectional Transformer for Person Re-identification},
author = {Ying Shu and Pujian Zhan and Huiqi Yang and Hehe Fan and Youfang Lin and Kai Lv},
journal= {arXiv preprint arXiv:2602.01059},
year = {2026}
}