基于 DINOv2 的视频-based 可见-红外行人重识别动作表示学习
计算机视觉与模式识别
2025-11-07 v1
摘要
视频-based 可见-红外行人重识别 (VVI-ReID) 旨在从视频序列中检索同一行人在可见和红外模态下的表现。现有方法倾向于利用模态不变的视觉特征,但大量忽略了行走特征,这些特征不仅是模态不变的,而且在时序动态方面丰富,从而限制了其建模跨模态视频匹配所必需的时空一致性的能力。为解决这些挑战,我们提出了 DINOv2 驱动的行走表示学习 (DinoGRL) 框架,该框架利用 DINOv2 的丰富视觉先验知识来学习行走特征,以补充外观线索,实现跨模态检索的稳健序列级表示。具体而言,我们引入了语义感知的剪影和行走学习 (SASGL) 模型,该模型生成并增强带有来自 DINOv2 的通用语义先验知识的剪影表示,并联合优化 ReID 目标,以实现语义丰富且任务自适应的行走特征学习。此外,我们开发了渐进式双向多粒度增强 (PBMGE) 模块,通过在多个空间粒度上实现行走和外观流之间的双向交互,充分利用它们的互补性,以丰富的局部细节增强全局表示,产生高度判别性的特征。大量实验在 HITSZ-VCM 和 BUPT 数据集上表明,我们的方法优于现有最先进的方法,表现显著优于现有方法。
引用
@article{arxiv.2511.04281,
title = {DINOv2 Driven Gait Representation Learning for Video-Based Visible-Infrared Person Re-identification},
author = {Yujie Yang and Shuang Li and Jun Ye and Neng Dong and Fan Li and Huafeng Li},
journal= {arXiv preprint arXiv:2511.04281},
year = {2025}
}