中文

生成式语音增强训练目标探究

音频与语音处理 2025-01-22 v2 声音

摘要

生成式语音增强在改善噪声环境下的语音质量方面近期展现出可喜的进展。现有的多种基于扩散的框架各自采用了不同的训练目标和学习技术。本文旨在通过聚焦于基于分数的生成模型和 Schrödinger bridge 的研究,来解释这些框架之间的差异。我们进行了一系列全面的实验以比较它们的性能,并突出了不同的训练行为。此外,我们提出了一种专为 Schrödinger bridge 框架量身定制的新型感知损失函数,展示了增强的性能以及改善的增强语音信号感知质量。所有实验代码和预训练模型均公开提供,以促进该领域的进一步研究与开发。

关键词

引用

@article{arxiv.2409.10753,
  title  = {Investigating Training Objectives for Generative Speech Enhancement},
  author = {Julius Richter and Danilo de Oliveira and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2409.10753},
  year   = {2025}
}

备注

Accepted at ICASSP 2025