DeepFuse:一种融合 IMU 的实时多视点图像三维人体姿态估计网络
计算机视觉与模式识别
2019-12-10 v1
摘要
本文提出一种两阶段全三维网络,即 DeepFuse,通过深度融合穿戴式惯性测量单元(IMU)数据与多视点图像来估计三维空间中的人体姿态。第一阶段用于纯视觉估计。为保留多视点输入的数据原始性,视觉阶段使用多通道体作为数据表示,并以 3D soft-argmax 作为激活层。第二阶段为 IMU 精化阶段,引入 IMU-骨骼层,在数据层面更早地融合 IMU 与视觉数据。无需预先给定骨架模型,我们即可在 TotalCapture 数据集上达到 28.9 mm 的平均关节误差,在 Human3.6M 数据集协议 1 下达到 13.4 mm,大幅改进了 SOTA 结果。最后,我们通过实验讨论了全三维网络用于三维姿态估计的有效性,或有益于未来研究。
引用
@article{arxiv.1912.04071,
title = {DeepFuse: An IMU-Aware Network for Real-Time 3D Human Pose Estimation from Multi-View Image},
author = {Fuyang Huang and Ailing Zeng and Minhao Liu and Qiuxia Lai and Qiang Xu},
journal= {arXiv preprint arXiv:1912.04071},
year = {2019}
}