中文

通过显式说话人一致性建模提升目标说话人提取

声音 2025-08-12 v3 音频与语音处理

摘要

目标说话人提取(TSE)使用参考线索从混合语音中提取目标语音。在依赖音频线索的TSE系统中,来自注册语音的说话人嵌入对性能至关重要。然而,这些嵌入可能受到说话人身份混淆的影响。不同于以前聚焦于改进说话人嵌入提取的研究,我们从说话人一致性的角度来提升TSE性能。本文提出了一种包含基于中心的说话人一致性损失的说话人一致性感知目标说话人提取方法。该方法通过确保注册语音与提取语音之间的说话人一致性来提升TSE性能。此外,我们将条件损失抑制集成到训练过程中。实验结果验证了我们提出方法在提升TSE性能方面的有效性。一个语音演示可在线上提供:https://sc-tse.netlify.app/。

关键词

引用

@article{arxiv.2507.09510,
  title  = {Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling},
  author = {Shu Wu and Anbin Qi and Yanzhang Xie and Xiang Xie},
  journal= {arXiv preprint arXiv:2507.09510},
  year   = {2025}
}

备注

preprint