面向大场景分组检测的可感知遮挡时空Transformer方法
计算机视觉与模式识别
2023-10-31 v1
摘要
群体检测,尤其是针对大尺度场景的群体检测,在公共安全和智慧城市方面具有诸多潜在应用。现有方法难以应对多人员大尺度场景中频繁的遮挡,且难以有效利用时空信息。本文提出一种端到端框架 GroupTransformer,用于大尺度场景中的群体检测。为处理多人造成的频繁遮挡,我们设计了一个遮挡编码器来检测并抑制严重遮挡的人员裁剪图像。为探索潜在的时空关系,我们提出时空Transformer,以分层方式同时提取轨迹信息并融合人际特征。在大规模与小规模场景上的实验结果表明,相比当前最优(SOTA)方法,我们的方法取得了更优性能。在大规模场景中,我们的方法在精确率和 F1 分数上显著提升了超过 10%。在小规模场景中,我们的方法仍使 F1 分数提升超过 5%。带有代码的项目页面见 http://cic.tju.edu.cn/faculty/likun/projects/GroupTrans。
引用
@article{arxiv.2310.19447,
title = {Towards Grouping in Large Scenes with Occlusion-aware Spatio-temporal Transformers},
author = {Jinsong Zhang and Lingfeng Gu and Yu-Kun Lai and Xueyang Wang and Kun Li},
journal= {arXiv preprint arXiv:2310.19447},
year = {2023}
}
备注
11 pages, 5 figures