中文

基于源-滤波器神经声码器的混响建模

声音 2020-05-18 v1 音频与语音处理

摘要

本文提出一种用于基于源-滤波器神经声码器的混响模块,可改进混响效应建模的性能。该模块以神经声码器的输出波形作为输入,并通过将输入与房间脉冲响应(RIR)卷积来产生混响波形。我们提出两种参数化并估计 RIR 的方法。第一种方法假设全局时不变(GTI)RIR,并直接在训练数据集上学习 RIR 的值。第二种方法假设语句级时变(UTV)RIR,其在单条语句内不变但跨语句变化,并使用另一个神经网络预测 RIR 值。我们将所提混响模块添加至 HiNet 声码器的相位谱预测器(PSP)中并联合训练模型。实验结果表明,所提模块有助于建模混响效应并提升生成混响语音的感知质量。UTV-RIR 相比 GTI-RIR 对未知混响条件更具鲁棒性,并实现了感知上更好的混响效果。

关键词

引用

@article{arxiv.2005.07379,
  title  = {Reverberation Modeling for Source-Filter-based Neural Vocoder},
  author = {Yang Ai and Xin Wang and Junichi Yamagishi and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2005.07379},
  year   = {2020}
}

备注

Submitted to Interspeech 2020