中文

利用异方差不确定性学习复杂谱映射用于单通道语音增强

声音 2023-03-09 v3 机器学习 音频与语音处理

摘要

大多数语音增强(SE)模型学习点估计,且在学习过程中未利用不确定性估计。本文中,我们通过最小化多元高斯负对数似然(NLL)来建模异方差不确定性,以零额外成本提升SE性能。训练期间,我们的方法用一个临时子模型增强学习复杂谱映射的模型,以预测每个时频 bin 上增强误差的协方差。由于无限制的异方差不确定性,该协方差引入欠采样效应,不利于SE性能。为缓解欠采样,我们的方法抬高不确定性下界,并以各自不确定性加权每个损失分量,用更多惩罚有效补偿严重欠采样分量。我们的多元设定揭示了标量矩阵与对角矩阵等常见协方差假设。通过弱化这些假设,我们表明 NLL 相比包括均方误差(MSE)、平均绝对误差(MAE)和尺度不变信失真比(SI-SDR)在内的流行损失函数取得了更优性能。

关键词

引用

@article{arxiv.2211.08624,
  title  = {Leveraging Heteroscedastic Uncertainty in Learning Complex Spectral Mapping for Single-channel Speech Enhancement},
  author = {Kuan-Lin Chen and Daniel D. E. Wong and Ke Tan and Buye Xu and Anurag Kumar and Vamsi Krishna Ithapu},
  journal= {arXiv preprint arXiv:2211.08624},
  year   = {2023}
}

备注

5 pages. Accepted at ICASSP 2023