中文

从稀疏信号进行场景感知人体运动估计的统一扩散框架

计算机视觉与模式识别 2024-04-09 v1

摘要

通过头戴式显示器和手柄控制器在3D场景中的稀疏跟踪信号估计全身人体运动,对于增强现实/虚拟现实应用至关重要。该任务的最大挑战之一是从稀疏观测到密集全身运动的一对多映射,这带来了固有的歧义性。为帮助解决这一歧义问题,我们引入了一个新框架,结合场景提供的丰富上下文信息,以改善从稀疏观测进行的全身运动跟踪。为在给定稀疏跟踪信号和3D场景的情况下估计合理的人体运动,我们开发了S2\text{S}^2Fusion,一个融合场景和稀疏信号的条件扩散模型的统一框架。S2\text{S}^2Fusion首先通过周期性自编码器提取稀疏信号中的时空关系,然后生成时间对齐的特征嵌入作为额外输入。随后,通过从预训练先验中提取初始噪声运动,S2\text{S}^2Fusion利用条件扩散融合场景几何和稀疏跟踪信号,生成全身场景感知运动。S2\text{S}^2Fusion的采样过程进一步由专门设计的场景穿透损失和相位匹配损失引导,即使在没有任何跟踪信号的情况下也能有效正则化下半身的运动,使生成的运动更加合理和连贯。大量实验结果表明,我们的S2\text{S}^2Fusion在估计质量和平滑度方面均优于现有最先进方法。

关键词

引用

@article{arxiv.2404.04890,
  title  = {A Unified Diffusion Framework for Scene-aware Human Motion Estimation from Sparse Signals},
  author = {Jiangnan Tang and Jingya Wang and Kaiyang Ji and Lan Xu and Jingyi Yu and Ye Shi},
  journal= {arXiv preprint arXiv:2404.04890},
  year   = {2024}
}