中文

Mean of Means:无校准且灵活摄像设置下的人类定位

计算机视觉与模式识别 2025-02-19 v1 图形学

摘要

准确的人类定位对于各种应用至关重要,尤其是在元宇宙时代。现有的高精度解决方案依赖昂贵且依赖标签的硬件,而基于视觉的方法提供了更经济、无标签的替代方案。然而,当前基于立体视觉的解决方案受制于刚性透视变换原理以及多阶段 SVD 求解器中误差传播的限制。这类方案也需要多个高分辨率摄像头并附带严格的 setup 约束。为此,本文提出一种概率方法,将人体上的所有点视为围绕身体几何中心的分布生成的观测,从而显著提升采样效率,将每个感兴趣点的样本数从数百提升至数十亿。通过建模世界坐标均值与像素坐标均值之间的关系,利用中心极限定理确保正态性并促进学习过程。实验结果表明,本方法在0.3米精度范围内实现96%的人类定位准确率,甚至在0.5米精度范围内接近100%准确率,仅需10美元使用分辨率为640×480像素的两个网络摄像头即可实现。

关键词

引用

@article{arxiv.2502.13017,
  title  = {Mean of Means: Human Localization with Calibration-free and Unconstrained Camera Settings (extended version)},
  author = {Tianyi Zhang and Wengyu Zhang and Xulu Zhang and Jiaxin Wu and Xiao-Yong Wei and Jiannong Cao and Qing Li},
  journal= {arXiv preprint arXiv:2502.13017},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2407.20870