中文

基于模型匹配原理的阵列式全神经网络双耳渲染系统在音频远程呈现中的设计

音频与语音处理 2023-03-07 v2 声音

摘要

远程呈现旨在为近端用户创造对远端音视频场景的沉浸式虚拟体验。本文提出一种基于阵列的双耳渲染系统,将阵列麦克风信号转换为经头相关传输函数(HRTF)滤波的输出信号以用于耳机渲染。所提方法依据模型匹配原理(MMP)构建,相比传统的定位-波束成形-HRTF 滤波(LBH)方法能够提供更沉浸的体验。基于 MMP 的渲染系统可通过多通道逆滤波(MIF)和多通道深度滤波(MDF)实现。本研究中我们采用 MDF 方法,并以 LBH 和 MIF 作为基线。该全神经系统在生成双耳输出前,联合捕获空间信息(空间渲染)、保留环境声(增强)并降低噪声(增强)。我们采用客观与主观测试将所提远程呈现系统与两种基线进行比较。

关键词

引用

@article{arxiv.2210.11123,
  title  = {Model-matching Principle Applied to the Design of an Array-based All-neural Binaural Rendering System for Audio Telepresence},
  author = {Yicheng Hsu and Chenghumg Ma and Mingsian R. Bai},
  journal= {arXiv preprint arXiv:2210.11123},
  year   = {2023}
}

备注

accepted by ICASSP 2023