通过学习人与场景交互填充三维场景
计算机视觉与模式识别
2021-04-06 v2
摘要
人类生活在三维空间中并不断与之交互以执行任务。此类交互涉及具有语义意义的表面间物理接触。我们的目标是学习人类如何与场景交互,并利用这一点使虚拟角色也能如此。为此,我们引入一种新的人-场景交互(HSI)模型,编码邻近关系,称为 POSA("Pose with prOximitieS and contActs",具邻近与接触的姿态)。该交互表示以身体为中心,使其能泛化到新场景。具体而言,POSA 增强 SMPL-X 参数化人体模型,使得对每个网格顶点,它编码(a)与场景表面的接触概率以及(b)对应的语义场景标签。我们用以 SMPL-X 顶点为条件的 VAE 学习 POSA,并在 PROX 数据集上训练,该数据集包含与三维场景交互的人们的 SMPL-X 网格,以及来自 PROX-E 数据集的相应场景语义。我们通过两个应用展示 POSA 的价值。首先,我们自动将人的三维扫描放置于场景中。我们使用拟合到扫描的 SMPL-X 模型作为代理,然后寻找其在三维中最可能的放置位姿。POSA 提供有效表示以搜索场景中匹配该姿态可能接触关系的“可供性”。我们进行的感知研究表明,在此任务上显著优于最先进水平。其次,我们展示 POSA 学习到的人体-场景交互表示支持与三维场景一致的单目人体姿态估计,改进了最先进水平。我们的模型和代码可用于研究目的:https://posa.is.tue.mpg.de。
引用
@article{arxiv.2012.11581,
title = {Populating 3D Scenes by Learning Human-Scene Interaction},
author = {Mohamed Hassan and Partha Ghosh and Joachim Tesch and Dimitrios Tzionas and Michael J. Black},
journal= {arXiv preprint arXiv:2012.11581},
year = {2021}
}