中文

PoseKernelLifter:利用声音对三维人体姿态进行度量提升

计算机视觉与模式识别 2021-12-06 v2 声音 音频与语音处理

摘要

从单视图图像以度量尺度重建人的三维姿态是一个几何上不适定的问题。例如,若无额外场景假设(如已知身高),我们无法从单视图图像测量人到相机的精确距离。现有的基于学习的方法通过重建尺度未知的 3D 姿态规避此问题。然而,诸如虚拟远程呈现、机器人和增强现实等许多应用都需要度量尺度重建。本文中,我们表明与图像同时记录的音频信号提供了互补信息以重建人的度量 3D 姿态。关键洞见是,当音频信号穿越 3D 空间时,其与身体的相互作用提供了关于身体姿态的度量信息。基于该洞见,我们引入一种时不变传递函数称为姿态核(pose kernel)——由身体姿态诱发的音频信号的冲激响应。姿态核的主要特性为:(1)其包络与 3D 姿态高度相关;(2)时间响应对应于到达时间,指示到麦克风的度量距离;(3)其对场景几何配置的变化具有不变性。因此,它易于泛化至未见过场景。我们设计了一个多阶段 3D CNN,融合音频与视觉信号并学习以度量尺度重建 3D 姿态。我们展示了我们的多模态方法在真实场景中产生准确的度量重建,这是包括参数化网格回归和深度回归在内的最先进提升方法所无法做到的。

关键词

引用

@article{arxiv.2112.00216,
  title  = {PoseKernelLifter: Metric Lifting of 3D Human Pose using Sound},
  author = {Zhijian Yang and Xiaoran Fan and Volkan Isler and Hyun Soo Park},
  journal= {arXiv preprint arXiv:2112.00216},
  year   = {2021}
}