中文

发声身体:基于身体姿态与音频的人体三维空间声音建模

计算机视觉与模式识别 2023-11-14 v1 机器学习 声音 音频与语音处理

摘要

尽管三维人体建模在计算机视觉中备受关注,但其声学对应问题——即对人体运动与语音产生的三维空间音频进行建模——在该领域仍显不足。为弥补这一差距,我们提出了一种能够为完整人体生成精确三维空间音频的模型。该系统以头戴麦克风采集的音频信号与身体姿态作为输入,输出环绕发射者身体的三维声场,由此可在三维空间中任意位置渲染空间音频。我们采集了首个多模态人体数据集,使用多台相机与由345个麦克风组成的球形阵列记录。在实证评估中,我们证明当使用合适的损失函数训练时,该模型能够生成精确的身体诱发声场。数据集与代码已在线发布。

关键词

引用

@article{arxiv.2311.06285,
  title  = {Sounding Bodies: Modeling 3D Spatial Sound of Humans Using Body Pose and Audio},
  author = {Xudong Xu and Dejan Markovic and Jacob Sandakly and Todd Keebler and Steven Krenn and Alexander Richard},
  journal= {arXiv preprint arXiv:2311.06285},
  year   = {2023}
}

备注

37th Conference on Neural Information Processing Systems (NeurIPS 2023)