中文

从全局到局部:重新思考 CLIP 特征聚合用于人员识别

计算机视觉与模式识别 2026-04-27 v1 人工智能

摘要

基于 CLIP 的人员重新识别 (ReID) 方法将空间特征聚合到单个全局 \texttt{[CLS]} 标记上,该标记针对图像-文本对齐进行优化,而非空间选择性,这导致在遮挡和跨摄像头变化情况下表征极其脆弱。我们提出 SAGA-ReID,通过将中间 patch 标记与在 CLIP 文本嵌入空间中参数化的锚点向量对齐来重构身份表示——强调空间稳定证据,同时抑制损坏或缺失的区域,且无需针对 individual 图像提供文本描述。通过控制实验在两种质事实不同条件下隔离聚合机制——合成遮挡 (缺乏身份信号) 和 现实人类干扰 (引入重叠人员的语义混淆信号)——实验证明 SAGA 相对于全局池化的优势随遮挡程度在两种条件下均显著增大。在基准评估中,SAGA 在标准和遮挡设置下均优于 CLIP-ReID,最大提升达到 +10.6 Rank-1,在全局池化最不可靠的遮挡基准上取得显著改进。SAGA 的聚合在更强的 backbone 上优于专门的顺序 patch 聚合,表明结构化的重构解决了一个瓶颈问题——这一瓶颈问题无法仅通过 backbone 质量和架构复杂度来解决。代码可在 https://github.com/ipl-uw/Structured-Anchor-Guided-Aggregation-for-ReID 查阅。

关键词

引用

@article{arxiv.2604.22190,
  title  = {From Global to Local: Rethinking CLIP Feature Aggregation for Person Re-Identification},
  author = {Aotian Zheng and Winston Sun and Bahaa Alattar and Vitaly Ablavsky and Jenq-Neng Hwang},
  journal= {arXiv preprint arXiv:2604.22190},
  year   = {2026}
}

备注

14 pages, 7 figures