MVUDA:面向多视角行人检测的无监督域适应
计算机视觉与模式识别
2024-12-06 v1
摘要
我们解决了多视角行人检测中的一个问题:标记数据是使用与测试时不同的多摄像机设置收集的。虽然最近的多视角行人检测器在训练所用的摄像机组上表现良好,但当应用于不同的设置时,其性能会下降。为了促进模型在各种摄像机组上的无缝部署,我们提出了一种无监督域适应 (UDA) 方法,该方法无需额外的标记数据即可使模型适应新的摄像机组。具体来说,我们利用均值教师自训练框架,并采用一种专为多视角行人检测设计的新型伪标签技术。该方法在多个基准测试上取得了最先进的性能,包括 MultiviewXWildtrack。与以往方法不同,我们的方法消除了对外部标记单目数据集的需求,从而减少了对标记数据的依赖。广泛的评估证明了我们方法的有效性,并验证了关键的设计选择。通过实现跨摄像机设置的鲁棒适应,我们的工作增强了多视角行人检测器的实用性,并为未来的研究建立了一个强大的 UDA 基线。
引用
@article{arxiv.2412.04117,
title = {MVUDA: Unsupervised Domain Adaptation for Multi-view Pedestrian Detection},
author = {Erik Brorsson and Lennart Svensson and Kristofer Bengtsson and Knut Åkesson},
journal= {arXiv preprint arXiv:2412.04117},
year = {2024}
}