中文

OSSEM:基于元学习的一次性说话人自适应语音增强

音频与语音处理 2021-11-11 v1 声音

摘要

尽管深度学习(DL)在语音增强(SE)方面取得了显著进展,但基于DL的SE系统要有效且高效地适应特定说话人仍需进一步研究。在本研究中,我们提出一种新颖的基于元学习的说话人自适应SE方法(称为OSSEM),旨在以一次性方式实现SE模型自适应。OSSEM由一个改进的transformer SE网络和一个说话人特定掩码(SSM)网络组成。实践中,SSM网络利用ECAPA-TDNN提取的注册说话人嵌入,通过掩码调整输入的含噪特征。为评估OSSEM,我们设计了一个改进的Voice Bank-DEMAND数据集,其中测试集中的一条语句用于模型自适应,其余语句用于测试性能。此外,我们设定限制使增强过程可实时进行,从而将OSSEM设计为因果SE系统。实验结果首先表明,OSSEM仅用一条语句即可将预训练SE模型有效自适应到特定说话人,从而获得改进的SE结果。同时,OSSEM相较于最先进的因果SE系统表现出具有竞争力的性能。

关键词

引用

@article{arxiv.2111.05703,
  title  = {OSSEM: one-shot speaker adaptive speech enhancement using meta learning},
  author = {Cheng Yu and Szu-Wei Fu and Tsun-An Hsieh and Yu Tsao and Mirco Ravanelli},
  journal= {arXiv preprint arXiv:2111.05703},
  year   = {2021}
}