捕获与推断密集的全身人体-场景接触
计算机视觉与模式识别
2022-06-22 v1
摘要
推断人体-场景接触(HSC)是理解人类如何与其周围环境交互的第一步。尽管检测 2D 人-物交互(HOI)和重建 3D 人体姿态与形状(HPS)已取得显著进展,但从单张图像中推理 3D 人体-场景接触仍然具有挑战性。现有的 HSC 检测方法仅考虑少数几种预定义的接触类型,通常将身体和场景简化为少量基元,甚至忽略图像证据。为了从单张图像预测人体-场景接触,我们从数据和算法两个角度解决了上述局限性。我们捕获了一个名为 RICH 的新数据集,代表“真实场景、交互、接触和人类”。RICH 包含 4K 分辨率的多视角室外/室内视频序列、通过无标记动作捕捉捕获的真值 3D 人体、3D 人体扫描以及高分辨率 3D 场景扫描。RICH 的一个关键特征是它还包含身体上精确的顶点级接触标签。使用 RICH,我们训练了一个从单张 RGB 图像预测密集身体-场景接触的网络。我们的关键洞察是,接触区域总是被遮挡的,因此网络需要具备探索整张图像以寻找证据的能力。我们使用 Transformer 来学习这种非局部关系,并提出了一种新的身体-场景接触 Transformer(BSTRO)。很少有方法探索 3D 接触;那些探索 3D 接触的方法仅关注脚部,将脚部接触检测作为后处理步骤,或者在不查看场景的情况下从人体姿态推断接触。据我们所知,BSTRO 是第一种直接从单张图像估计 3D 身体-场景接触的方法。我们证明 BSTRO 显著优于现有技术。代码和数据集可在 https://rich.is.tue.mpg.de 获取。
引用
@article{arxiv.2206.09553,
title = {Capturing and Inferring Dense Full-Body Human-Scene Contact},
author = {Chun-Hao P. Huang and Hongwei Yi and Markus Höschle and Matvey Safroshkin and Tsvetelina Alexiadis and Senya Polikovsky and Daniel Scharstein and Michael J. Black},
journal= {arXiv preprint arXiv:2206.09553},
year = {2022}
}
备注
CVPR 2022