中文

基于自监督学习深度点云配准的 XR 多模态全身跟踪

机器学习 2024-11-28 v1

摘要

在 XR (AR/VR) 设备中跟踪用户全身运动是带来真实社交存在感的基本挑战。由于缺乏专用腿部传感器,当前可用的身体跟踪方法采用合成方法,基于来自头部和控制器的 3 点信号生成合理的运动。为了实现混合现实功能,现代 XR 设备能够利用可用传感器结合专用机器学习模型估计头盔周围的深度信息。这种自我中心深度感知无法直接驱动身体,因为其未注册且由于视野有限和身体自遮挡而不完整。首次提出利用可用深度感知信号结合自监督学习,训练出一种能够在 XR 设备上实时跟踪全身运动的多模态姿态估计模型。我们展示了如何将当前的 3 点运动合成模型扩展到点云模态,方法是结合语义点云编码器网络和残差网络进行多模态姿态估计。这些模块以自监督方式联合训练,利用真实未注册点云和来自运动捕捉的仿真数据的组合。我们对比了 several 最先进的 XR 身体跟踪系统,显示该方法能够准确跟踪多样化的身体运动。XR-MBT 首次实现了 XR 中的腿部跟踪,而传统基于部分身体跟踪的合成方法则不行。

关键词

引用

@article{arxiv.2411.18376,
  title  = {Preserving Deep Representations In One-Shot Pruning: A Hessian-Free Second-Order Optimization Framework},
  author = {Ryan Lucas and Rahul Mazumder},
  journal= {arXiv preprint arXiv:2411.18376},
  year   = {2024}
}

备注

10 pages excl. appendix