中文

用于语音增强的自监督嵌入提升方法

音频与语音处理 2022-07-06 v2

摘要

语音的自监督学习(SSL)表示在多个下游任务上取得了最先进(SOTA)的性能。然而,在语音增强(SE)任务上仍有改进空间。在本研究中,我们使用跨域特征来解决 SSL 嵌入可能缺乏用于再生语音信号的细粒度信息的问题。通过整合 SSL 表示与频谱图,结果可以得到显著提升。我们进一步通过纯净-噪声距离(CN distance)研究了 SSL 表示的噪声鲁棒性与 SE 的层重要性之间的关系。结果发现,噪声鲁棒性较低的 SSL 表示更为重要。此外,我们在 VCTK-DEMAND 数据集上的实验表明,使用 SE 模型对 SSL 表示进行微调,在 PESQ、CSIG 和 COVL 上可以超越 SOTA 的基于 SSL 的 SE 方法,而无需引入复杂的网络架构。在后续实验中,观察到微调后 SSL 嵌入中的 CN 距离有所增加。这些结果验证了我们的预期,并可能有助于未来设计面向 SE 的 SSL 训练。

关键词

引用

@article{arxiv.2204.03339,
  title  = {Boosting Self-Supervised Embeddings for Speech Enhancement},
  author = {Kuo-Hsuan Hung and Szu-wei Fu and Huan-Hsin Tseng and Hsin-Tien Chiang and Yu Tsao and Chii-Wann Lin},
  journal= {arXiv preprint arXiv:2204.03339},
  year   = {2022}
}

备注

accepted to INTERSPEECH-2022