SoloSpeech:通过级联生成式流水线增强目标语音提取中的可懂度与质量
音频与语音处理
2025-09-09 v3 人工智能
声音
摘要
目标语音提取(TSE)旨在利用特定说话人线索(通常作为辅助音频提供,又称线索音频),从多个说话人的混合语音中分离出目标说话人的声音。尽管近期 TSE 的进展主要采用了具有高感知质量的判别式模型,但这些模型常会引入不想要的伪影、降低自然度,并且对训练与测试环境之间的差异敏感。另一方面,用于 TSE 的生成式模型在感知质量和可懂度方面存在滞后。为了应对这些挑战,我们提出了 SoloSpeech,一种集成了压缩、提取、重构和校正过程的新型级联生成式流水线。SoloSpeech 采用无说话人嵌入的目标提取器,利用来自线索音频潜在空间的条件信息,将其与混合音频的潜在空间对齐以防止不匹配。在广泛使用的 Libri2Mix 数据集上进行评估,SoloSpeech 在目标语音提取中实现了新的 SOTA 可懂度和质量,同时在域外数据和真实场景中展现出卓越的泛化能力。
引用
@article{arxiv.2505.19314,
title = {SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline},
author = {Helin Wang and Jiarui Hai and Dongchao Yang and Chen Chen and Kai Li and Junyi Peng and Thomas Thebaud and Laureano Moro Velazquez and Jesus Villalba and Najim Dehak},
journal= {arXiv preprint arXiv:2505.19314},
year = {2025}
}