中文

自监督学习足以填补空白吗?语音修复研究

声音 2025-12-09 v2 计算与语言 音频与语音处理

摘要

语音修复包括使用周围上下文重建损坏或缺失的语音片段,这一过程与自监督学习(SSL)语音编码器的预训练任务非常相似。本研究调查了使用SSL训练的语音编码器进行修复,无需在初始预训练任务之外进行额外训练,只需添加一个解码器来生成波形。我们将这种方法与监督微调语音编码器用于下游任务(此处为修复)进行了比较。实际上,我们将HuBERT作为SSL编码器,HiFi-GAN作为解码器,以两种配置集成:(1) 微调解码器以对齐冻结的预训练编码器的输出,以及(2) 微调编码器以基于冻结解码器输入执行修复任务。在单说话人和多说话人条件下,使用域内数据集和域外数据集(包括未见过的说话人、多样的说话风格和噪声)进行评估。考虑了知情和盲修复场景,其中损坏片段的位置已知或未知。所提出的基于SSL的方法与多个基线进行了基准测试,包括一种结合自动语音识别与零样本文本到语音合成的文本知情方法。使用客观指标和感知评估来评估性能。结果表明,两种方法都优于基线,成功重建了长达200毫秒、有时甚至长达400毫秒的语音片段。值得注意的是,在单说话人设置中,微调SSL编码器实现了更准确的语音重建,而预训练编码器在多说话人场景中更为有效。这表明SSL预训练任务可以迁移到语音修复,从而通过预训练编码器实现成功的语音重建。

关键词

引用

@article{arxiv.2405.20101,
  title  = {Is Self-Supervised Learning Enough to Fill in the Gap? A Study on Speech Inpainting},
  author = {Ihab Asaad and Maxime Jacquelin and Olivier Perrotin and Laurent Girin and Thomas Hueber},
  journal= {arXiv preprint arXiv:2405.20101},
  year   = {2025}
}

备注

Accepted for publication to Computer Speech and Language journal (to appear)