中文

VILLS——用于行人重识别的视频-图像学习语义方法

计算机视觉与模式识别 2024-10-28 v7

摘要

行人重识别是具有显著现实应用的研究领域。尽管近期取得进展,现有方法在真实场景下的鲁棒重识别仍面临挑战,例如仅关注特定模态及服装等不可靠模式。高度通用的算法备受期待,但因空间与时间分辨率的权衡及不完美特征提取等问题而难以实现。我们提出 VILLS(Video-Image Learning to Learn Semantics,视频-图像学习语义),一种从图像与视频联合学习空间和时间特征的自监督方法。VILLS 首先设计局部语义提取模块,自适应提取语义一致且鲁棒的空间特征。随后,VILLS 设计统一特征学习与适配模块,将图像与视频模态表征于一致特征空间。通过利用自监督大规模预训练,VILLS 建立了显著优于现有基于图像与视频方法的新 State-of-The-Art。

关键词

引用

@article{arxiv.2311.17074,
  title  = {VILLS -- Video-Image Learning to Learn Semantics for Person Re-Identification},
  author = {Siyuan Huang and Ram Prabhakar and Yuxiang Guo and Rama Chellappa and Cheng Peng},
  journal= {arXiv preprint arXiv:2311.17074},
  year   = {2024}
}