X-CrossNet:基于交叉注意力说话人嵌入融合的复杂谱映射目标说话人提取方法
声音
2024-11-26 v2 多媒体
音频与语音处理
摘要
目标说话人提取 (TSE) 是一种从混合语音中隔离目标说话人语音的技术,利用与目标说话人相关联的辅助特征。它是解决鸡尾酒问题的另一种方法,通常被认为比传统语音分离方法具有更实际的应用前景。尽管该领域的学术研究在公共数据集上取得了高性能和高评估分数,但大多数模型在现实世界嘈杂或回声条件下表现显著下降。为解决这一局限性,我们提出一种新型 TSE 模型 X-CrossNet,该模型以 CrossNet 作为 backbone。CrossNet 是为处理嘈杂和回声环境而优化的语音分离网络,在此类条件下实现了说话人分离等任务的业界表现。此外,为增强网络捕获和利用目标说话人辅助特征的能力,我们将交叉注意力机制集成到每个 CrossNet 块中的全局多头自注意力 (GMHSA) 模块中。这 facilitates 更有效地将目标说话人特征与混合语音特征集成。实验结果表明,我们的方法在 WSJ0-2mix 和 WHAMR! 数据集上实现了优异的分离效果,显示出强大的鲁棒性和稳定性。
引用
@article{arxiv.2411.13811,
title = {X-CrossNet: A complex spectral mapping approach to target speaker extraction with cross attention speaker embedding fusion},
author = {Chang Sun and Bo Qin},
journal= {arXiv preprint arXiv:2411.13811},
year = {2024}
}