任意未标定相机网络中的多视角行人匹配与 3D 姿态估计
计算机视觉与模式识别
2023-12-05 v1
摘要
当相机外参未标定时,多相机网络中的跨视角行人匹配与 3D 人体姿态估计尤为困难。现有工作通常需要大量 3D 数据来训练神经网络,或需要已知的相机位姿作为几何约束来求解该问题。然而,相机位姿与 3D 数据标注通常成本高昂且并不总是可获取的。我们提出了一种方法 PME,在不需要上述任何信息的情况下解决这两个任务。我们的思路是将跨视角行人匹配作为聚类问题处理,以每个人作为聚类中心,随后从行人匹配中获取对应关系,并通过多视角三角测量与光束法平差估计 3D 人体姿态。我们通过引入利用相机数量的“规模约束”以及利用同一相机视角中的两个人不应匹配这一事实的“来源约束”来求解该聚类问题,从而将解空间缩小至一个较小的可行域。聚类中使用的 2D 人体姿态通过预训练的 2D 姿态检测器获取,因此我们的方法不需要为每个新场景准备昂贵的 3D 训练数据。我们在三个开源数据集以及使用任意设置相机收集的两个室内外数据集上对我们的方法进行了广泛评估。我们的方法在跨视角行人匹配上大幅优于其他方法,在不使用相机位姿或 3D 训练数据的情况下在 3D 人体姿态估计上达到了 SOTA 性能,并在五个不同环境设置的数据集上展现出良好的泛化能力。
引用
@article{arxiv.2312.01561,
title = {Multi-View Person Matching and 3D Pose Estimation with Arbitrary Uncalibrated Camera Networks},
author = {Yan Xu and Kris Kitani},
journal= {arXiv preprint arXiv:2312.01561},
year = {2023}
}