NASTAR:基于目标条件重采样的噪声自适应语音增强
音频与语音处理
2022-06-22 v1 机器学习
摘要
对于基于深度学习的语音增强(SE)系统,训练与测试之间的声学不匹配会导致显著的性能下降。为解决这一不匹配问题,已衍生出多种噪声自适应策略。本文提出一种新方法,称为基于目标条件重采样的噪声自适应语音增强(NASTAR),该方法仅需目标环境中一个含噪语音样本(单样本)即可减少不匹配。NASTAR使用反馈机制,通过噪声提取器和检索模型来模拟自适应训练数据。噪声提取器从含噪语音中估计目标噪声,称为伪噪声。噪声检索模型根据含噪语音从噪声信号池中检索相关噪声样本,称为相关队列。伪噪声和相关队列集被联合采样并与源语音语料库混合,以制备用于噪声自适应的模拟训练数据。实验结果表明,NASTAR能有效利用单个含噪语音样本使SE模型适应目标条件。此外,噪声提取器和噪声检索模型均有助于模型自适应。据我们所知,NASTAR是首个通过噪声提取和检索进行单样本噪声自适应的工作。
引用
@article{arxiv.2206.09058,
title = {NASTAR: Noise Adaptive Speech Enhancement with Target-Conditional Resampling},
author = {Chi-Chang Lee and Cheng-Hung Hu and Yu-Chen Lin and Chu-Song Chen and Hsin-Min Wang and Yu Tsao},
journal= {arXiv preprint arXiv:2206.09058},
year = {2022}
}
备注
Accepted to Interspeech 2022