中文

TF-CLIP:基于无文本 CLIP 的视频行人重识别学习

计算机视觉与模式识别 2023-12-18 v1 信息检索 机器学习 多媒体

摘要

大规模语言-图像预训练模型(如 CLIP)在许多跨模态检索任务中表现出优越的性能。然而,将此类模型学习到的知识迁移到基于视频的行人重识别(ReID)的问题却鲜有探索。此外,当前的 ReID 基准测试缺乏合适的文本描述。为了解决这些问题,本文提出了一种名为 TF-CLIP 的基于无文本 CLIP 的单阶段学习框架,用于基于视频的行人 ReID。具体而言,我们提取身份特定的序列特征作为 CLIP-Memory 来替代文本特征。同时,我们设计了序列特定提示(SSP)模块来在线更新 CLIP-Memory。为了捕获时序信息,我们进一步提出了时序记忆扩散(TMD)模块,该模块由两个关键组件组成:时序记忆构建(TMC)和记忆扩散(MD)。在技术上,TMC 允许序列中的帧级记忆相互通信,并基于序列内的关系提取时序信息。MD 进一步将时序记忆扩散到原始特征中的每个 token,以获得更鲁棒的序列特征。大量实验表明,我们提出的方法在 MARS、LS-VID 和 iLIDS-VID 上比其他最先进方法表现出更好的结果。代码可在 https://github.com/AsuradaYuci/TF-CLIP 获取。

关键词

引用

@article{arxiv.2312.09627,
  title  = {TF-CLIP: Learning Text-free CLIP for Video-based Person Re-Identification},
  author = {Chenyang Yu and Xuehu Liu and Yingquan Wang and Pingping Zhang and Huchuan Lu},
  journal= {arXiv preprint arXiv:2312.09627},
  year   = {2023}
}

备注

This work is accepted by AAAI2024