中文

基于失真控制训练与辅助自编码损失的端到端混响语音分离

音频与语音处理 2020-11-17 v1

摘要

随着近期端到端神经网络架构的进展,无回声环境下语音增强与分离系统的性能已显著提升。然而,此类系统在混响环境中的性能尚待探索。混响语音分离的一个核心问题关乎训练与评估指标。标准时域指标可能在训练时引入非预期失真,并因混响的存在而无法恰当评估分离性能。本文中,我们首先引入混响分离中的“等值轮廓”问题,即多个输出可导致常用指标衡量的相同性能。我们随后研究如何通过辅助自编码训练(A2T)选取具有更低目标特定失真的“更优”输出。A2T假设分离通过对混合信号进行线性操作完成,并在直接路径目标信号的自编码上添加损失项,以确保分离过程中直接路径信号上引入的失真受控。对分离信号质量与语音识别准确率的评估表明,A2T能够控制直接路径信号上的失真并提升识别准确率。

关键词

引用

@article{arxiv.2011.07338,
  title  = {Distortion-controlled Training for End-to-end Reverberant Speech Separation with Auxiliary Autoencoding Loss},
  author = {Yi Luo and Cong Han and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2011.07338},
  year   = {2020}
}

备注

SLT 2021