面向确定源分离的替代源模型学习
音频与语音处理
2020-11-12 v1 声音
信号处理
摘要
我们提出为确定盲语音分离学习通用语音先验的替代函数。深度语音先验因其强大的建模能力而备受青睐,但与基于majorization-minimization(AuxIVA)的先进独立向量分析不兼容,因为推导所需的替代函数并不容易,也并非总是可行。相反,我们放弃精确的majorization,直接近似替代函数。利用迭代源导向(ISS)更新,我们通过AuxIVA的多次迭代对置换不变分离损失进行反向传播。ISS因其较低复杂度和无需矩阵求逆而非常适用于此任务。实验表明,与基线方法相比,在尺度不变信号失真比(SDR)和词错误率方面均有大幅改善。训练在双说话人混合语音上进行,我们尝试了SDR和相干性两种损失。我们发现所学得的近似替代函数在无需任何修改的情况下能很好地泛化到三和四说话人混合语音。我们还展示了其对AuxIVA更新方程另一种变体的泛化能力。SDR损失导致迭代收敛最快,而相干性导致最低的词错误率(WER)。我们获得了高达36%的WER降低。
引用
@article{arxiv.2011.05540,
title = {Surrogate Source Model Learning for Determined Source Separation},
author = {Robin Scheibler and Masahito Togami},
journal= {arXiv preprint arXiv:2011.05540},
year = {2020}
}
备注
5 pages, 3 figures, 1 table. Submitted to ICASSP 2021