从非因果到因果的 SSL 支持迁移学习:面向高性能低延迟语音声码器
音频与语音处理
2024-08-27 v2
摘要
最近,BigVGAN 作为高性能语音声码器涌现出来。其基于序列到序列的合成方法限制了其在低延迟对话应用中的使用。我们的工作通过三步解决了这一局限。首先,我们通过实现因果卷积将低延迟引入 BigVGAN,导致性能下降。其次,为了恢复性能,我们提出了一种教师-学生迁移学习方案,将高延迟非因果 BigVGAN 蒸馛到我们的低延迟因果声码器中。最后,利用自监督学习 (SSL) 模型(本例中为 wav2vec 2.0),我们对来自我们低延迟因果声码器提取的语音表示与真实值进行对齐。在说话人独立的设置下,我们提出的两种训练方案显著提升了我们的低延迟声码器性能,接近原始高延迟 BigVGAN。仅增加 21% 的复杂度,我们的最佳小型因果声码器实现 3.96 PESQ 和 1.25 MCD,甚至优于原始小型非因果 BigVGAN (3.64 PESQ),分别提高了 0.32 PESQ 和 0.1 MCD 分。
引用
@article{arxiv.2408.11842,
title = {Non-Causal to Causal SSL-Supported Transfer Learning: Towards a High-Performance Low-Latency Speech Vocoder},
author = {Renzheng Shi and Andreas Bär and Marvin Sach and Wouter Tirry and Tim Fingscheidt},
journal= {arXiv preprint arXiv:2408.11842},
year = {2024}
}
备注
Accepted at IWAENC 2024