基于幅度与时间谱近似损失优化的说话人提取神经网络
音频与语音处理
2019-03-26 v1 计算与语言
声音
摘要
SpeakerBeam-FE (SBF) 方法被提出用于说话人提取。它试图解决源分离过程中录音内说话人数量未知的问题。SBF 的掩码近似损失是次优的,因为它不计算直接的信号重建误差,也未考虑语音上下文。为了解决这些问题,本文提出了一种幅度与时间谱近似损失,以利用说话人特征为目标说话人估计相位敏感掩码。此外,本文探索了一种拼接框架,以替代 SBF 方法中的上下文自适应深度神经网络,将说话人嵌入编码到掩码估计网络中。开放评估条件下的实验结果表明,所提出的方法在信号失真比(SDR)和语音质量感知评估(PESQ)上分别比 SBF 基线取得了 70.4% 和 17.7% 的相对提升。进一步分析表明,所提出的方法在不同性别和相同性别混合物中分别取得了 69.1% 和 72.3% 的相对 SDR 提升。
关键词
引用
@article{arxiv.1903.09952,
title = {Optimization of Speaker Extraction Neural Network with Magnitude and Temporal Spectrum Approximation Loss},
author = {Chenglin Xu and Wei Rao and Eng Siong Chng and Haizhou Li},
journal= {arXiv preprint arXiv:1903.09952},
year = {2019}
}
备注
Accepted in ICASSP 2019