中文

Geneses:统一的生成式语音增强与分离

声音 2026-01-27 v1 音频与语音处理

摘要

真实世界的音频录音通常包含多个说话人以及各种退化现象,这限制了可用于构建 SOTA 语音处理模型的语音数据的数量与质量。尽管将语音增强(SE)与语音分离(SS)级联以获取每个说话人干净语音信号的端到端方法颇具前景,但传统的 SE-SS 方法难以应对加性噪声之外的复杂退化。为此,我们提出了 \textbf{Geneses},一个实现统一、高质量 SE--SS 的生成式框架。我们的 Geneses 利用潜流匹配,以基于含噪混合物的自监督学习表示为条件的多模态扩散 Transformer,来估计每个说话人的干净语音特征。我们使用 LibriTTS-R 中的双说话人混合数据,在仅加性噪声和复杂退化两种条件下进行了实验评估。结果表明,Geneses 在各项客观指标上均显著优于传统的基于掩码的 SE--SS 方法,且对复杂退化具有高度鲁棒性。音频样本可在我们的演示页面获取。

关键词

引用

@article{arxiv.2601.18456,
  title  = {Geneses: Unified Generative Speech Enhancement and Separation},
  author = {Kohei Asai and Wataru Nakata and Yuki Saito and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2601.18456},
  year   = {2026}
}

备注

Accepted to ICASSP 2025 workshop