中文

基于滤波噪声整形的混响语音时域房间脉冲响应估计

音频与语音处理 2021-07-16 v1 声音

摘要

深度学习方法已崭露头角,旨在转换音频信号使其听起来如同在与参考录音相同的房间中录制,应用于音频后期制作与增强现实。本文中,我们提出 FiNS,一种滤波噪声整形网络,可直接从混响语音估计时域房间脉冲响应(RIR)。我们受领域启发的架构包含时域编码器与滤波噪声整形解码器,后者将 RIR 建模为衰减滤波噪声信号之和,并包含直达声与早期反射分量。先前的声学匹配方法要么使用大型模型转换音频以匹配目标房间,要么预测算法混响器的参数。相反,对 RIR 的盲估计可通过单次卷积实现高效且真实的转换。一项评估表明,我们的模型不仅合成出匹配目标房间参数(如 T60T_{60} 与 DRR)的 RIR,而且相较于深度学习基线,在试听测试中更能准确复现目标房间的感知特性。

关键词

引用

@article{arxiv.2107.07503,
  title  = {Filtered Noise Shaping for Time Domain Room Impulse Response Estimation From Reverberant Speech},
  author = {Christian J. Steinmetz and Vamsi Krishna Ithapu and Paul Calamia},
  journal= {arXiv preprint arXiv:2107.07503},
  year   = {2021}
}

备注

Accepted to WASPAA 2021. See details at https://facebookresearch.github.io/FiNS/