面向目标说话人提取的多层说话人表征
音频与语音处理
2024-12-12 v2 声音
摘要
目标说话人提取 (TSE) 依赖于目标的参考线索从混合语音中提取目标语音。虽然通常使用说话人嵌入作为参考线索,但这种预训练于大量说话人的嵌入可能因说话人身份混淆而受限。本文提出一种多层次说话人表征方法,从原始特征到神经嵌入,作为说话人参考线索。我们从 enrollment 幅度语谱图生成谱级表征作为原始低层特征,显著提高了模型的泛化能力。此外,我们提出一种基于跨注意力机制的上下文嵌入特征,将来自预训练说话人编码器的帧级嵌入整合其中。通过整合跨多个层次的说话人特征,我们显著增强了 TSE 模型的性能。在 Libri2mix 测试集上,我们的方法相对于基线实现了 2.74 dB 的提升和 4.94% 的提取准确率提高。
引用
@article{arxiv.2410.16059,
title = {Multi-Level Speaker Representation for Target Speaker Extraction},
author = {Ke Zhang and Junjie Li and Shuai Wang and Yangjie Wei and Yi Wang and Yannan Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2410.16059},
year = {2024}
}
备注
5 pages. Submitted to ICASSP 2025. Implementation will be released at https://github.com/wenet-e2e/wesep