感知与预测:基于自监督语音表示的损失函数用于语音增强
声音
2023-06-27 v3 计算与语言
机器学习
音频与语音处理
摘要
近期语音增强领域的工作探索了使用自监督语音表示来辅助神经语音增强模型的训练。然而,此类工作多聚焦于使用自监督语音表示模型的最深层或最终输出,而非较早的特征编码。以这种方式使用自监督表示往往缺乏充分动机。本文表明,干净语音与带噪语音的特征编码之间的距离与心理声学驱动的语音质量及可懂度度量,以及人类平均意见得分(MOS)评级高度相关。我们使用该距离作为损失函数进行了实验,并借助感知语音质量评估(PESQ)与短时客观可懂度(STOI)等客观度量,展示了相较基于 STFT 谱图距离的损失以及语音增强文献中其他常见损失函数的性能提升。
引用
@article{arxiv.2301.04388,
title = {Perceive and predict: self-supervised speech representation based loss functions for speech enhancement},
author = {George Close and William Ravenscroft and Thomas Hain and Stefan Goetze},
journal= {arXiv preprint arXiv:2301.04388},
year = {2023}
}
备注
4 pages, accepted at ICASSP 2023