中文

SoloSpeech:通过级联生成式流水线增强目标语音提取中的可懂度与质量

音频与语音处理 2025-09-09 v3 人工智能 声音

摘要

目标语音提取(TSE)旨在利用特定说话人线索(通常作为辅助音频提供,又称线索音频),从多个说话人的混合语音中分离出目标说话人的声音。尽管近期 TSE 的进展主要采用了具有高感知质量的判别式模型,但这些模型常会引入不想要的伪影、降低自然度,并且对训练与测试环境之间的差异敏感。另一方面,用于 TSE 的生成式模型在感知质量和可懂度方面存在滞后。为了应对这些挑战,我们提出了 SoloSpeech,一种集成了压缩、提取、重构和校正过程的新型级联生成式流水线。SoloSpeech 采用无说话人嵌入的目标提取器,利用来自线索音频潜在空间的条件信息,将其与混合音频的潜在空间对齐以防止不匹配。在广泛使用的 Libri2Mix 数据集上进行评估,SoloSpeech 在目标语音提取中实现了新的 SOTA 可懂度和质量,同时在域外数据和真实场景中展现出卓越的泛化能力。

关键词

引用

@article{arxiv.2505.19314,
  title  = {SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline},
  author = {Helin Wang and Jiarui Hai and Dongchao Yang and Chen Chen and Kai Li and Junyi Peng and Thomas Thebaud and Laureano Moro Velazquez and Jesus Villalba and Najim Dehak},
  journal= {arXiv preprint arXiv:2505.19314},
  year   = {2025}
}