中文

FRAME: 面向 Avatar 动作的地面对齐表示来自 Egocentric 视频

计算机视觉与模式识别 2025-04-01 v1

摘要

佩戴头戴式身体正视立体相机的环视运动捕捉对于 VR 和 AR 应用至关重要,但面临显著挑战,如严重遮挡和有限的注释实物数据。现有方法依赖合成预训练,在实际场景中难以生成平滑且准确的预测,尤其是对于下肢。我们的工作通过引入轻量级基于 VR 的数据收集 setup,配合 onboard 实时 6D 位姿跟踪来克服这些限制。使用该 setup,我们收集了目前规模和运动变异性最广的实物数据集用于面向环视的佩戴式摄像机。有效地整合来自不同数据源的多模态输入——设备位姿和摄像头 feed——具有挑战性。为此,我们提出 FRAME,一种简单而有效的 architecture,将设备位姿和摄像头 feed 结合用于 state-of-the-art 身体姿态预测,通过几何上严谨的多模态集成,可在现代硬件上以 300 FPS 的速度运行。最后,我们展示了一种新颖的训练策略来增强模型的泛化能力。我们的方法利用问题的几何特性,产出无常规作品的高质量运动捕捉。定性和定量评估,以及大量比较,均显示我们方法的有效性。数据、代码和 CAD 设计将在 https://vcai.mpi-inf.mpg.de/projects/FRAME/ 上提供。

关键词

引用

@article{arxiv.2503.23094,
  title  = {FRAME: Floor-aligned Representation for Avatar Motion from Egocentric Video},
  author = {Andrea Boscolo Camiletto and Jian Wang and Eduardo Alvarado and Rishabh Dabral and Thabo Beeler and Marc Habermann and Christian Theobalt},
  journal= {arXiv preprint arXiv:2503.23094},
  year   = {2025}
}

备注

Accepted at CVPR 2025