FutureHuman3D:从视频观测预测复杂的长期三维人体行为
计算机视觉与模式识别
2024-05-20 v3 机器学习
摘要
我们提出了一种生成式方法,用于预测三维空间中长期的未来人体行为,仅需来自易获取的二维人体动作数据的弱监督。这是一项基础性任务,可赋能许多下游应用。所需的真实数据在三维中难以采集(动作捕捉服、昂贵设备),但在二维中易于获取(简易RGB相机)。因此,我们设计的方法在推理时仅需二维RGB数据,同时能够生成三维人体运动序列。我们以自回归方式使用可微二维投影方案进行弱监督,并使用对抗损失进行三维正则化。我们的方法可预测由多个子动作组成的长期且复杂的人体行为序列(例如烹饪、装配)。我们以语义分层的方式处理该问题,联合预测高层粗粒度动作标签及其作为特征性三维人体姿态的低层细粒度具体实现。我们观察到这两种动作表征本质上相互耦合,且联合预测有益于动作与姿态的预测。我们的实验证明了联合动作与三维姿态预测的互补性:我们的联合方法优于单独处理的各任务,实现了更鲁棒的更长时序序列预测,并在预测动作与特征性三维姿态的替代方法上有所提升。
引用
@article{arxiv.2211.14309,
title = {FutureHuman3D: Forecasting Complex Long-Term 3D Human Behavior from Video Observations},
author = {Christian Diller and Thomas Funkhouser and Angela Dai},
journal= {arXiv preprint arXiv:2211.14309},
year = {2024}
}
备注
Project Page: https://future-human-3d.christian-diller.de/ Video: https://www.youtube.com/watch?v=18du85YFXL0