中文

EgoPoseVR:面向虚拟现实的自我姿态的时空多模态推理

计算机视觉与模式识别 2026-02-06 v1 新兴技术 图形学

摘要

沉浸式虚拟现实(VR)应用需要准确且时序一致的全身姿态跟踪。近期基于头戴摄像头的方法在自我姿态估计方面取得了一些进展,但在应用于VR头戴显示器(HMD)时面临时序不稳定、下半身估计不准以及缺乏实时性能等挑战。为此,我们提出EgoPoseVR,一个用于VR中准确自我全身姿态估计的端到端框架,通过双模态融合管线将头盔运动线索与自我RGB-D观测相结合。时空编码器提取帧级和关节级表征,经跨注意力融合后充分利用跨模态的运动线索。随后,运动学优化模块施加HMD信号约束,提高姿态估计的准确性和稳定性。为便于训练和评估,我们构建了一个包含180万个以上在 diverse VR 场景下同步对齐的HMD和RGB-D帧的大规模合成数据集。实验结果表明,EgoPoseVR在各种自我姿态估计模型中取得优异性能。真实场景的用户研究进一步显示,EgoPoseVR在准确性、稳定性、投射感以及未来使用意图等方面的主观评分显著高于基线方法。这些结果表明,EgoPoseVR实现了稳健的全身姿态跟踪,为无需额外身体佩戴传感器或房间级跟踪系统即可实现准确的VR投射提供了实用解决方案。

关键词

引用

@article{arxiv.2602.05590,
  title  = {EgoPoseVR: Spatiotemporal Multi-Modal Reasoning for Egocentric Full-Body Pose in Virtual Reality},
  author = {Haojie Cheng and Shaun Jing Heng Ong and Shaoyu Cai and Aiden Tat Yang Koh and Fuxi Ouyang and Eng Tat Khoo},
  journal= {arXiv preprint arXiv:2602.05590},
  year   = {2026}
}