基于扩散模型的无监督盲联合去混响与房间声学估计
音频与语音处理
2025-03-26 v2 机器学习
声音
摘要
本文提出了一种用于单通道盲去混响和房间脉冲响应(RIR)估计的无监督方法,称为 BUDDy。该算法植根于贝叶斯后验采样:它结合了一个强制对混响测量保真的似然模型,以及一个由无条件扩散模型实现的消声语音先验。我们设计了一个表示 RIR 的参数化滤波器,每个频率子带具有指数衰减特性。房间声学估计和语音去混响是联合进行的,因为滤波器参数在反向扩散轨迹中被迭代估计,同时语音话语被逐步精化。在 RIR 未知的盲场景下,BUDDy 成功地在各种声学场景中执行了语音去混响,显著优于其他盲无监督基线。与通常难以泛化的有监督方法不同,BUDDy 能无缝适应不同的声学条件。本文扩展了我们之前的工作,提供了新的实验结果和对算法通用性的见解。我们通过客观指标和主观听音评估,证明了所提方法对新的声学和说话人条件的鲁棒性,以及其对高分辨率歌声去混响的适应性。我们研究了 BUDDy 在 RIR 估计上的性能,并观察到它在不匹配的声学条件下超越了最先进的有监督 DNN 估计器。最后,我们探讨了有参考去混响方法对 RIR 估计误差的敏感性,从而论证了联合声学估计与去混响设计的动机。音频示例和代码可在线获取。
引用
@article{arxiv.2408.07472,
title = {Unsupervised Blind Joint Dereverberation and Room Acoustics Estimation with Diffusion Models},
author = {Jean-Marie Lemercier and Eloi Moliner and Simon Welker and Vesa Välimäki and Timo Gerkmann},
journal= {arXiv preprint arXiv:2408.07472},
year = {2025}
}
备注
Submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing