中文

可微分人工混响

声音 2022-07-21 v3 音频与语音处理

摘要

人工混响(AR)模型在各种音频应用中起着核心作用。因此,估计参考混响的 AR 模型参数(ARP)是一项关键任务。尽管近期少数基于深度学习的方法已展现出有前景的性能,其非端到端训练方案阻碍了它们充分利用深度神经网络的潜力。这促使了可微分人工混响(DAR)模型的引入,使得损失梯度能够端到端反向传播。然而,在深度学习框架中“原样”以差分方程实现 AR 模型,由于其无限冲激响应(IIR)分量,在使用 GPU 等并行处理器执行时会严重瓶颈化训练速度。我们通过用频率采样方法的有限冲激响应(FIR)近似替换 IIR 滤波器来解决该问题。利用此技术,我们实现了三种 DAR 模型——可微分滤波天鹅绒噪声(FVN)、高级滤波天鹅绒噪声(AFVN)和延迟网络(DN)。对于每个 AR 模型,我们以其对应的 DAR 模型,端到端地训练其用于分析-合成(RIR 到 ARP)和盲估计(混响语音到 ARP)任务的 ARP 估计网络。实验结果表明,所提方法在客观指标和主观听感测试结果上均比非端到端方法取得了一致的性能提升。

关键词

引用

@article{arxiv.2105.13940,
  title  = {Differentiable Artificial Reverberation},
  author = {Sungho Lee and Hyeong-Seok Choi and Kyogu Lee},
  journal= {arXiv preprint arXiv:2105.13940},
  year   = {2022}
}

备注

Accepted to TASLP