基于 CG-CLIP 的高难度视频人体重识别框架
计算机视觉与模式识别
2026-04-10 v1 人工智能
摘要
近年来,基于视频的人体重识别(ReID)因其能够利用时空线索在非重叠摄像头之间匹配个体而受到关注。然而,当前方法在高难度场景(如运动和舞蹈表演)中难以应对:这些场景中存在多个穿相似服装且做出动态动作的个体。为克服这些挑战,我们提出了 CG-CLIP(Caption-guided CLIP),一种新颖的 caption-guided CLIP 框架,利用显式文本描述和可学习标记。我们的方法引入了两个关键组件:Caption-guided Memory Refinement(CMR)和 Token-based Feature Extraction(TFE)。CMR 利用来自多模态大语言模型(MLLMs)生成的标题来细化身份特定特征,捕捉细粒度细节。TFE 采用固定长度可学习标记的跨注意力机制,高效聚合时空特征,降低计算开销。我们在两个标准数据集(MARS 和 iLIDS-VID)上评估了该方法,并构建了两个新建的高难度数据集(SportsVReID 和 DanceVReID)。实验结果表明,该方法在所有基准测试中均超越当前最先进的方法,取得显著改进。
引用
@article{arxiv.2604.07740,
title = {Beyond Pedestrians: Caption-Guided CLIP Framework for High-Difficulty Video-based Person Re-Identification},
author = {Shogo Hamano and Shunya Wakasugi and Tatsuhito Sato and Sayaka Nakamura},
journal= {arXiv preprint arXiv:2604.07740},
year = {2026}
}