通过联合优化与目标说话人 ASR 提升生成式目标语音提取的可理解性
音频与语音处理
2025-05-22 v2 声音
摘要
目标语音提取(TSE)从多说话者叠加语音中隔离特定说话人的语音。目前大多数TSE模型依赖判别式方法,通常预测目标语音的时间频率声谱掩码。然而,这些掩码的不完美会导致目标语音/非目标语音的过/欠抑制,降低感知质量。生成式方法则基于混合语音和目标说话人线索重建目标语音,实现更佳的感知质量。然而,这些方法常忽视语音可理解性,导致重建语音中语义内容被改变或丢失。灵感来自Whisper模型在目标说话人语音识别方面的成功,本文提出一种基于预训练Whisper模型的生成式TSE框架,以解决上述问题。该框架集成了语义建模与流式声学建模,实现高可理解性与感知质量的平衡。来自多个基准测试的结果表明,所提方法优于现有的生成式和判别式基线方法。我们将在 https://aisaka0v0.github.io/GenerativeTSE_demo/ 上提供语音样本。
引用
@article{arxiv.2501.14477,
title = {Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR},
author = {Hao Ma and Rujin Chen and Xiao-Lei Zhang and Ju Liu and Xuelong Li},
journal= {arXiv preprint arXiv:2501.14477},
year = {2025}
}
备注
Submitted to IEEE Signal Processing Letters