一种统一实时个性化与非个性化语音增强框架
音频与语音处理
2023-02-24 v1 声音
摘要
在本研究中,我们提出一种训练单一语音增强网络的方法,该网络可同时执行个性化与非个性化语音增强。这是通过引入一个逐帧条件输入来指定增强输出类型实现的。为提升增强输出质量并缓解过抑制,我们尝试根据语音活动存在与否对帧重新加权,并对说话人嵌入施加增强。通过在多任务学习设定下训练,我们凭经验表明所提出的统一模型在个性化与非个性化语音增强基准上均取得有前景的结果,并达到与专为任一任务训练的模型相近的性能。该方法的强劲性能表明,在推理阶段统一模型相较于保留独立的任务专用模型是一种更经济的替代方案。
引用
@article{arxiv.2302.11768,
title = {A Framework for Unified Real-time Personalized and Non-Personalized Speech Enhancement},
author = {Zhepei Wang and Ritwik Giri and Devansh Shah and Jean-Marc Valin and Michael M. Goodwin and Paris Smaragdis},
journal= {arXiv preprint arXiv:2302.11768},
year = {2023}
}
备注
Accepted by ICASSP 2023