中文

面向目标说话人提取的多层说话人表征

音频与语音处理 2024-12-12 v2 声音

摘要

目标说话人提取 (TSE) 依赖于目标的参考线索从混合语音中提取目标语音。虽然通常使用说话人嵌入作为参考线索,但这种预训练于大量说话人的嵌入可能因说话人身份混淆而受限。本文提出一种多层次说话人表征方法,从原始特征到神经嵌入,作为说话人参考线索。我们从 enrollment 幅度语谱图生成谱级表征作为原始低层特征,显著提高了模型的泛化能力。此外,我们提出一种基于跨注意力机制的上下文嵌入特征,将来自预训练说话人编码器的帧级嵌入整合其中。通过整合跨多个层次的说话人特征,我们显著增强了 TSE 模型的性能。在 Libri2mix 测试集上,我们的方法相对于基线实现了 2.74 dB 的提升和 4.94% 的提取准确率提高。

关键词

引用

@article{arxiv.2410.16059,
  title  = {Multi-Level Speaker Representation for Target Speaker Extraction},
  author = {Ke Zhang and Junjie Li and Shuai Wang and Yangjie Wei and Yi Wang and Yannan Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2410.16059},
  year   = {2024}
}

备注

5 pages. Submitted to ICASSP 2025. Implementation will be released at https://github.com/wenet-e2e/wesep