噪声目标训练:一种无需干净语音的基于 DNN 的语音增强训练策略
音频与语音处理
2021-05-11 v2
摘要
基于深度神经网络(DNN)的语音增强通常需要以干净语音信号作为训练目标。然而,收集干净信号成本很高,因为它们必须在录音棚中录制。这一要求目前将语音增强的训练数据量限制为不需要干净信号的语音识别的不到 1/1000。增加训练数据量对提升性能至关重要,因此应放宽对干净信号的要求。在本文中,我们提出一种不需要干净信号的训练策略。所提方法仅利用噪声信号进行训练,这使我们能够使用野外各种语音信号。我们的实验结果表明,所提方法可以达到与使用干净信号训练的 DNN 相似的性能。
引用
@article{arxiv.2101.08625,
title = {Noisy-target Training: A Training Strategy for DNN-based Speech Enhancement without Clean Speech},
author = {Takuya Fujimura and Yuma Koizumi and Kohei Yatabe and Ryoichi Miyazaki},
journal= {arXiv preprint arXiv:2101.08625},
year = {2021}
}