中文

通过声学原语建模与驱动人体声场

声音 2024-07-23 v2 计算机视觉与模式识别 音频与语音处理

摘要

尽管在过去的几年中,光照真实的 3D 人体模型的渲染与动画已取得显著进步,但对于此类完整人体模型相关的空间音频建模工作仍鲜有追求。本文提出了一种框架,能够实现高质量的空间音频生成,能够渲染由人体产生的完整三维声场,包括语音、脚步声、手部-人体相互作用等。给定一个基本的人体姿态和来自头戴式麦克风的音频表示,我们演示了可以在三维空间中的任意点高效且准确地渲染完整的声学场景。为实现近场和实时声场渲染,我们借鉴了图形神经渲染中体积原语的思想,将其引入声学领域。我们的声学原语结果为声场表示缩小了一个数量级,并克服了与前述方法相比在近场渲染中的不足。

关键词

引用

@article{arxiv.2407.13083,
  title  = {Modeling and Driving Human Body Soundfields through Acoustic Primitives},
  author = {Chao Huang and Dejan Markovic and Chenliang Xu and Alexander Richard},
  journal= {arXiv preprint arXiv:2407.13083},
  year   = {2024}
}

备注

ECCV 2024. Project Page: https://wikichao.github.io/Acoustic-Primitives/