PeR-ViS:基于语义描述视频监控中的行人检索
计算机视觉与模式识别
2020-12-07 v1
摘要
行人通常通过年龄、性别、身高、衣服类型、图案、颜色等描述符来刻画。此类描述符被称为属性及/或软生物特征(soft-biometrics)。它们弥合了视频监控中行人描述与检索之间的语义鸿沟。以语义描述作为查询来检索特定行人在视频监控中具有重要应用。利用计算机视觉完全自动化行人检索任务已引起研究界的兴趣。然而,当前趋势主要聚焦于基于图像查询的行人检索,这在实用中存在重大局限。本文不采用图像查询,而是研究基于语义描述的视频监控行人检索问题。为解决该问题,我们提出了一种基于深度学习的级联过滤方法(PeR-ViS),其使用 Mask R-CNN [14](行人检测与实例分割)和 DenseNet-161 [16](软生物特征分类)。在 SoftBioSearch [6] 标准行人检索数据集上,我们取得了 0.566 的平均 IoU 和 0.792 %w ,大幅超越当前最优(state-of-the-art)方法。我们希望这一简单、可复现且有效的方法能助力未来视频监控行人检索领域的研究。源代码与预训练权重见 https://parshwa1999.github.io/PeR-ViS/。
引用
@article{arxiv.2012.02408,
title = {PeR-ViS: Person Retrieval in Video Surveillance using Semantic Description},
author = {Parshwa Shah and Arpit Garg and Vandit Gajjar},
journal= {arXiv preprint arXiv:2012.02408},
year = {2020}
}
备注
10 pages, 6 figures, 3 tables; Human Activity Detection in multi-camera, Continuous, long-duration Video (HADCV'21)under the IEEE Winter Conf. on Applications of Computer Vision (WACV), Virtual Conference, January 5, 2021