MoViD:通过运动-视角解耦实现视角不变的3D人体姿态估计
计算机视觉与模式识别
2026-04-07 v1 人工智能
摘要
3D人体姿态估计是健康监测、人机协作和沉浸式游戏等应用的关键使能技术,但其在真实世界的部署仍受到视角变化的挑战。现有方法难以泛化到未见过的相机视角,需要大量训练数据,且推理延迟较高。我们提出MoViD,一个视角不变的3D人体姿态估计框架,将视角信息与运动特征解耦。其核心思想是从中间姿态特征中提取视角信息,并利用它来增强姿态估计的鲁棒性和效率。MoViD引入了一个视角估计器,通过对关键关节关系建模来预测视角信息,并引入一个正交投影模块来解耦运动和视角特征,进一步通过基于物理的跨视角对比对齐进行增强。为实现实时边缘部署,MoViD采用逐帧推理流水线,并配备视角感知策略,根据估计的视角自适应地激活翻转细化。在九个公开数据集以及新采集的多视角无人机和步态分析数据集上的评估表明,与最先进的方法相比,MoViD将姿态估计误差降低了超过24.2%,在使用少60%训练数据的情况下,在严重遮挡下仍能保持鲁棒性能,并在NVIDIA边缘设备上实现了15 FPS的实时推理。
引用
@article{arxiv.2604.03299,
title = {MoViD: View-Invariant 3D Human Pose Estimation via Motion-View Disentanglement},
author = {Yejia Liu and Hengle Jiang and Haoxian Liu and Runxi Huang and Xiaomin Ouyang},
journal= {arXiv preprint arXiv:2604.03299},
year = {2026}
}