Pose2Room:从人体活动理解三维场景
机器人学
2022-07-15 v2 计算机视觉与模式识别
摘要
借助可穿戴 IMU 传感器,人们无需视觉输入即可从穿戴设备估计人体姿态~\cite{von2017sparse}。在本工作中,我们提出一个问题:仅从人体轨迹信息,我们能否推理真实世界环境中的物体结构?关键在于,我们观察到人体运动与交互往往能给出场景中物体的强信息——例如一个人坐下表明可能存在椅子或沙发。为此,我们提出 P2R-Net,以学习场景中物体的概率化三维模型,该模型由物体类别与有向三维边界框刻画,其输入为环境中观测到的人体轨迹。P2R-Net 对物体类别的概率分布以及物体框的深度高斯混合模型进行建模,从而能够从观测到的人体轨迹中采样出多种不同的、可能的物体配置模式。在我们的实验中,我们表明 P2R-Net 能有效学习人体运动对应物体的多模态分布,并生成环境中多种合理的物体结构,即便没有任何视觉信息。结果表明,P2R-Net 在 PROX 数据集与 VirtualHome 平台上持续优于基线方法。
引用
@article{arxiv.2112.03030,
title = {Pose2Room: Understanding 3D Scenes from Human Activities},
author = {Yinyu Nie and Angela Dai and Xiaoguang Han and Matthias Nießner},
journal= {arXiv preprint arXiv:2112.03030},
year = {2022}
}
备注
Accepted by ECCV'2022; Project page: https://yinyunie.github.io/pose2room-page/ Video: https://www.youtube.com/watch?v=MFfKTcvbM5o