无监督多视角行人检测
计算机视觉与模式识别
2023-11-21 v2 多媒体
摘要
随着视频监控的普及,多摄像头已被应用于在特定区域内精确定位行人。然而,以往方法依赖于每一视频帧和摄像头视角下的人工标注,导致了超出必要的摄像头标定与同步负担。因此,本文提出一种无监督多视角行人检测(UMPD)方法,通过2D-3D映射消除对标注的需求来学习多视角行人检测器。1)首先,提出语义感知迭代分割(SIS),通过我们提出的迭代PCA和来自视觉-语言模型的零样本语义类别,提取多视角图像的无监督表示,并将其转换为2D行人掩码作为伪标签。2)其次,我们提出几何感知基于体的检测器(GVD),通过2D到3D几何投影将多视角2D图像端到端编码为3D体,以SIS伪标签的3D到2D渲染损失进行训练,预测体素级密度与颜色。3)第三,为获得更好的检测结果,即GVD投影到鸟瞰图(BEV)上的3D密度,我们提出垂直感知BEV正则化(VBR)将其约束为如自然行人姿态般的垂直形态。在流行的多视角行人检测基准Wildtrack、Terrace和MultiviewX上的大量实验表明,我们提出的UMPD方法作为据我们所知首个全无监督方法,性能可与先前最先进的(SOTA)有监督技术相竞争。代码将公开。
引用
@article{arxiv.2305.12457,
title = {Unsupervised Multi-view Pedestrian Detection},
author = {Mengyin Liu and Chao Zhu and Shiqi Ren and Xu-Cheng Yin},
journal= {arXiv preprint arXiv:2305.12457},
year = {2023}
}