中文

通过联合优化与目标说话人 ASR 提升生成式目标语音提取的可理解性

音频与语音处理 2025-05-22 v2 声音

摘要

目标语音提取(TSE)从多说话者叠加语音中隔离特定说话人的语音。目前大多数TSE模型依赖判别式方法,通常预测目标语音的时间频率声谱掩码。然而,这些掩码的不完美会导致目标语音/非目标语音的过/欠抑制,降低感知质量。生成式方法则基于混合语音和目标说话人线索重建目标语音,实现更佳的感知质量。然而,这些方法常忽视语音可理解性,导致重建语音中语义内容被改变或丢失。灵感来自Whisper模型在目标说话人语音识别方面的成功,本文提出一种基于预训练Whisper模型的生成式TSE框架,以解决上述问题。该框架集成了语义建模与流式声学建模,实现高可理解性与感知质量的平衡。来自多个基准测试的结果表明,所提方法优于现有的生成式和判别式基线方法。我们将在 https://aisaka0v0.github.io/GenerativeTSE_demo/ 上提供语音样本。

关键词

引用

@article{arxiv.2501.14477,
  title  = {Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR},
  author = {Hao Ma and Rujin Chen and Xiao-Lei Zhang and Ju Liu and Xuelong Li},
  journal= {arXiv preprint arXiv:2501.14477},
  year   = {2025}
}

备注

Submitted to IEEE Signal Processing Letters