中文

用于双耳语音渲染的神经傅里叶偏移方法

音频与语音处理 2023-05-02 v2 人工智能 多媒体 声音 信号处理

摘要

我们提出一种神经网络,用于从给定的单声道音频、声源的位置与朝向渲染双耳语音。以往大多数工作聚焦于通过在卷积神经网络的特征空间中以位置和朝向为条件来合成双耳语音。这些合成方法即使对野外数据也能有力估计目标双耳语音,但难以泛化到分布外域的音频渲染。为缓解此问题,我们提出神经傅里叶偏移(NFS),一种能在傅里叶空间实现双耳语音渲染的新型网络架构。具体而言,利用基于声源与接收者之间距离的几何时延,NFS 被训练以预测各种早期反射的时延与尺度。NFS 在内存与计算成本上均高效,具有可解释性,且因其设计而独立于声源域。实验结果表明,即使在内存轻 25 倍、计算少 6 倍的情况下,NFS 在基准数据集上的表现也与以往研究相当。

关键词

引用

@article{arxiv.2211.00878,
  title  = {Neural Fourier Shift for Binaural Speech Rendering},
  author = {Jin Woo Lee and Kyogu Lee},
  journal= {arXiv preprint arXiv:2211.00878},
  year   = {2023}
}

备注

Accepted by ICASSP 2023