中文

InterCap:人与物体交互的无标记联合三维跟踪

计算机视觉与模式识别 2022-10-04 v2

摘要

人类不断与日常物体交互以完成任务。为理解此类交互,计算机需要从观测全身与场景交互的相机中重建这些交互。这具有挑战性,原因在于身体与物体间的遮挡、运动模糊、深度/尺度歧义,以及手和可抓取物体部分的低图像分辨率。为使问题可解,学界要么关注交互的手部而忽略身体,要么关注交互的身体而忽略手。GRAB 数据集解决了灵巧全身交互问题,但使用基于标记的运动捕捉(MoCap)且缺乏图像;而 BEHAVE 捕获了身体-物体交互的视频但缺乏手部细节。我们通过 InterCap 弥补已有工作的局限,这是一种从多视角 RGB-D 数据重建交互的全身与物体的新方法,使用参数化全身模型 SMPL-X 和已知物体网格。为应对上述挑战,InterCap 利用两个关键观察:(i) 手与物体间的接触可用于改进二者的姿态估计。(ii) Azure Kinect 传感器使我们能够搭建简单的多视角 RGB-D 采集系统,在最小化遮挡影响的同时提供合理的相机间同步。利用该方法我们采集了 InterCap 数据集,包含 10 名受试者(5 男 5 女)与 10 个具有不同尺寸和可供性(affordance)的物体交互,包括手或脚的接触。总体而言,InterCap 拥有 223 段 RGB-D 视频,得到 67,357 个多视角帧,每帧含 6 张 RGB-D 图像。我们的方法为每视频帧提供伪真实身体网格与物体。我们的 InterCap 方法与数据集填补了文献中的重要空白,并支持诸多研究方向。我们的数据与代码可供研究用途。

关键词

引用

@article{arxiv.2209.12354,
  title  = {InterCap: Joint Markerless 3D Tracking of Humans and Objects in Interaction},
  author = {Yinghao Huang and Omid Tehari and Michael J. Black and Dimitrios Tzionas},
  journal= {arXiv preprint arXiv:2209.12354},
  year   = {2022}
}

备注

To appear at GCPR2022