Ego4o:基于多模态输入的环视人类运动捕捉与理解
计算机视觉与模式识别
2025-04-14 v1
摘要
本 work 聚焦于使用消费级可穿戴设备(如VR/AR头显、智能眼镜、手机和智能手表)进行人类运动的跟踪与理解。这些设备提供多样化的多模态传感器输入,包括环视图像和1-3个稀疏IMU传感器的不同组合。运动描述也可伴随这些信号。多样化的输入模态及其间歇性可用性为持续的运动捕捉和理解带来了挑战。本 work 提出了Ego4o(o代表omni),一个用于从多模态环视输入中同时进行人类运动捕捉和理解的新框架。该方法在部分输入可用时仍能保持性能,并在多个模态组合时取得更好结果。首先,IMU传感器输入、可选的环视图像以及人类运动文本描述被编码到运动VQ-VAE的潜在空间中。随后,潜在向量被发送到VQ-VAE解码器中进行优化,以跟踪人类运动。当运动描述不可用时,潜在向量可输入到多模态LLM中生成人类运动描述,这进一步可提高运动捕捉精度。定量和定性评估均显示了该方法在预测准确人类运动和高质量运动描述方面的有效性。
引用
@article{arxiv.2504.08449,
title = {Ego4o: Egocentric Human Motion Capture and Understanding from Multi-Modal Input},
author = {Jian Wang and Rishabh Dabral and Diogo Luvizon and Zhe Cao and Lingjie Liu and Thabo Beeler and Christian Theobalt},
journal= {arXiv preprint arXiv:2504.08449},
year = {2025}
}