基于长短期表征学习的视频行人重识别
计算机视觉与模式识别
2023-08-08 v1 多媒体
摘要
基于视频的行人重识别(V-ReID)旨在从非重叠摄像头捕获的原始视频中检索特定行人。作为一项基础任务,它支撑着许多多媒体与计算机视觉应用。然而,由于行人与场景的变化,要实现高性能仍须克服诸多障碍。在本工作中,我们注意到行人的长期与短期信息对于鲁棒的视频表征均十分重要。因此,我们提出了一种名为长短期表征学习(LSTRL)的新型深度学习框架,用于高效的V-ReID。更具体地,为提取长期表征,我们提出多粒度外观提取器(MAE),在多个帧中有效捕获四种粒度外观。同时,为提取短期表征,我们提出双向运动估计器(BME),从连续帧中高效提取交互运动信息。MAE与BME为即插即用模块,可轻松插入现有网络以进行高效特征学习。因此,它们显著提升了V-ReID的特征表征能力。在三个广泛使用的基准上的大量实验表明,我们所提方法优于大多数state-of-the-art方法。
引用
@article{arxiv.2308.03703,
title = {Video-based Person Re-identification with Long Short-Term Representation Learning},
author = {Xuehu Liu and Pingping Zhang and Huchuan Lu},
journal= {arXiv preprint arXiv:2308.03703},
year = {2023}
}
备注
This work is accepted by ICIG2023, including 13 pages, 5 figures and 5 tables. Modifications may be performed for further improvements