用于基于视频的人员重识别的时空 Transformer
计算机视觉与模式识别
2021-03-31 v1
摘要
近来,Transformer 模块已从自然语言处理移植到计算机视觉。本文将 Transformer 应用于基于视频的人员重识别,其中关键问题是从一个轨迹片段中提取判别性信息。我们表明,尽管具有强大的学习能力,原始 Transformer 由于大量注意力参数和训练数据不足,面临着过拟合风险增加的困扰。为解决该问题,我们提出了一种新颖的流程,其中模型在一组合成视频数据上预训练,然后通过感知约束的时空 Transformer(STT)模块和全局 Transformer(GT)模块迁移到下游域。所推导的算法在三个流行的基于视频的人员重识别基准 MARS、DukeMTMC-VideoReID 和 LS-VID 上取得了显著的精度提升,尤其在训练与测试数据来自不同域时。更重要的是,我们的研究为 Transformer 在高结构视觉数据上的应用提供了启示。
引用
@article{arxiv.2103.16469,
title = {Spatiotemporal Transformer for Video-based Person Re-identification},
author = {Tianyu Zhang and Longhui Wei and Lingxi Xie and Zijie Zhuang and Yongfei Zhang and Bo Li and Qi Tian},
journal= {arXiv preprint arXiv:2103.16469},
year = {2021}
}
备注
10 pages, 7 figures