Mem-MLP:稀疏输入下实时 3D 人体运动生成方法
计算机视觉与模式识别
2025-11-21 v1
摘要
逼真且平滑的全身跟踪对于沉浸式 AR/VR 应用至关重要。现有系统主要通过头戴式设备(HMDs)和控制器跟踪头部和手部,导致 3D 全身重建不完整。一种潜在方法是使用神经网络模型从稀疏输入(由有限传感器收集)生成全身运动。本文提出一种新方法,基于增强残差连接和一种新型神经网络组件(Memory-Block)的多层感知器(MLP)主干网络。具体而言,Memory-Block 使用可训练的 code-vectors 表示缺失的传感器数据,这些数据与前一时间实例的稀疏信号组合,以提高时序一致性。此外,我们将解决方案表述为多任务学习问题,使 MLP 主干网络能够学习鲁健的表征,从而提升精度。我们的实验表明,该方法在显著降低预测误差方面优于最先进的基线方法。此外,在移动 HMD 上实现 72 FPS,最终改善了精度与运行时间之间的权衡。
引用
@article{arxiv.2511.16264,
title = {Mem-MLP: Real-Time 3D Human Motion Generation from Sparse Inputs},
author = {Sinan Mutlu and Georgios F. Angelis and Savas Ozkan and Paul Wisbey and Anastasios Drosou and Mete Ozay},
journal= {arXiv preprint arXiv:2511.16264},
year = {2025}
}