USEF-TSE:通用无说话人嵌入目标说话人提取
音频与语音处理
2025-05-21 v3 声音
摘要
目标说话人提取旨在从混合语音中分离出特定说话人的声音。传统上,这一过程依赖于从参考语音中提取说话人嵌入,需使用说话人识别模型。然而,确定合适的说话人识别模型可能具有挑战性,并且将目标说话人嵌入作为参考信息可能并非对目标说话人提取任务最为理想。本文介绍了一种无需依赖说话人嵌入的通用说话人嵌入免目标说话人提取(Universal Speaker Embedding-Free Target Speaker Extraction, USEF-TSE)框架。USEF-TSE利用多头交叉注意力机制作为帧级目标说话人特征提取器。这种创新方法允许主流说话人提取解决方案绕过对说话人识别模型的依赖,更好地利用可用于 enrollment 语音中的信息,包括说话人特征和上下文细节。此外,USEF-TSE可以无缝集成到其他时域或时频域语音分离模型中,以实现有效的说话人提取。实验结果表明,我们提出的方法在WSJ0-2mix、WHAM!和WHAMR!数据集上以尺度不变信噪比失真(Scale-Invariant Signal-to-Distortion Ratio, SI-SDR)实现了最先进(SOTA)性能,这些数据集是单声道无反射、带噪声和带噪声-混响双说话人语音分离和说话人提取的标准基准。此外,在LibriMix和ICASSP 2023 DNS挑战盲测试集上的结果表明,该模型在更具多样性和跨域的数据上表现良好。有关源代码,请访问:https://github.com/ZBang/USEF-TSE。
引用
@article{arxiv.2409.02615,
title = {USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction},
author = {Bang Zeng and Ming Li},
journal= {arXiv preprint arXiv:2409.02615},
year = {2025}
}
备注
Accepted by IEEE Transactions on Audio, Speech and Language Processing (TASLP)