中文

基于潜在变分块状解耦的数声源分离

音频与语音处理 2024-02-13 v1 机器学习 声音

摘要

尽管神经网络方法在解决经典信号处理问题方面取得了显著进展,但往往是将信号处理和神经网络的见解结合起来才能得到更为完整的解决方案。本文提出了一种基于经典数字信号处理/深度神经网络 (DSP/DNN) 的混合方法,用于声源分离 (SS),并强调了变分自编码器与经典 SS 方法之间的理论联系。我们提出的系统将单通道欠定声源分离任务转化为在恰当设计的潜在空间中等价的多通道过定声源分离问题。潜在空间中的分离任务被视为寻找混合信号的变分块状解耦表示。我们通过实验表明,受经典信号处理理论结果启发的任务设计选择和变分公式,能够提高对不可见超分布数据的数据鲁棒性,并降低过拟合风险。为了解决 resulting 中的排列问题,我们显式地引入了一种新型可微分排列损失函数,并通过增强模型的记忆机制来跟踪各个声源的统计信息。

关键词

引用

@article{arxiv.2402.06683,
  title  = {Sound Source Separation Using Latent Variational Block-Wise Disentanglement},
  author = {Karim Helwani and Masahito Togami and Paris Smaragdis and Michael M. Goodwin},
  journal= {arXiv preprint arXiv:2402.06683},
  year   = {2024}
}