中文

结合频带分割RNN与说话人注意力模块的个性化语音增强

音频与语音处理 2023-03-17 v2 声音

摘要

目标说话人信息可用于语音增强(SE)模型中,以更有效地提取所需语音。以往工作通过拼接或仿射变换将说话人嵌入引入语音增强模型。本文提出一种说话人注意力模块,计算说话人嵌入与中间特征之间的注意力分数,并用于重新缩放特征。将该模块融入最先进的SE模型,我们构建了用于ICASSP信号处理大挑战赛DNS Challenge 5(2023)的个性化SE模型。我们的系统在track1盲测试集上取得0.529的最终分数,在track2上取得0.549的最终分数。

关键词

引用

@article{arxiv.2302.09953,
  title  = {Personalized speech enhancement combining band-split RNN and speaker attentive module},
  author = {Xiaohuai Le and Li Chen and Chao He and Yiqing Guo and Cheng Chen and Xianjun Xia and Jing Lu},
  journal= {arXiv preprint arXiv:2302.09953},
  year   = {2023}
}