基于源模型乘积的独立深度学习方法用于多通道音频源分离
声音
2021-09-03 v1 音频与语音处理
摘要
独立深度学习方法(IDLMA)是基于深度神经网络(DNN)的源功率估计的最先进的多通道音频源分离方法之一。基于 DNN 的功率估计对于音色与 DNN 训练数据相似的声音效果良好。然而,应用 IDLMA 的声音并不总是具有此类音色,且音色失配会导致 IDLMA 性能下降。为解决此问题,我们关注 IDLMA 的盲源分离对应方法——独立低秩矩阵分析。它使用非负矩阵分解(NMF)作为源模型,可利用源频谱图的低秩结构作为线索,捕获仅出现在目标混合中的源频谱分量。因此,我们基于专家乘积(product-of-expert)概念将基于 DNN 的源模型扩展为涵盖基于 NMF 的源模型,称之为源模型乘积(PoSM)。对于所提出的基于 PoSM 的 IDLMA,我们基于称为优化最小化算法(majorization-minimization algorithm)的优化原理推导了一种计算高效的参数估计算法。实验评估显示了所提方法的有效性。
引用
@article{arxiv.2109.00704,
title = {Multichannel Audio Source Separation with Independent Deeply Learned Matrix Analysis Using Product of Source Models},
author = {Takuya Hasumi and Tomohiko Nakamura and Norihiro Takamune and Hiroshi Saruwatari and Daichi Kitamura and Yu Takahashi and Kazunobu Kondo},
journal= {arXiv preprint arXiv:2109.00704},
year = {2021}
}
备注
8 pages, 5 figures, accepted for Asia-Pacific Signal and Information Processing Association Annual Summit and Conference 2021 (APSIPA ASC 2021)