中文

双流上下文融合网络:通过利用混合与注册交互实现高效目标说话人提取

声音 2025-02-13 v1 音频与语音处理

摘要

目标说话人提取旨在通过利用注册信号从多说话人环境中提取目标语音信号。现有方法主要依赖从注册信号中获取的说话人嵌入,可能忽略了上下文信息以及混合信号与注册信号之间的内部交互。本文提出了一种新颖的双流上下文融合网络(DCF-Net),工作在时频(T-F)域。具体而言,引入双流融合块(DSFB)以获取上下文信息并捕获注册信号与混合信号表示在空间和通道维度上的交互,然后利用丰富且一致的表示来引导提取网络以实现更好的提取效果。实验结果表明,DCF-Net 优于最先进(SOTA)方法,在基准数据集上实现了 21.6 dB 的尺度不变信噪比改善(SI-SDRi),并且在噪声和混响场景下均表现出鲁棒性和有效性。此外,我们模型的错误提取结果——即目标混淆问题——降至 0.4%,凸显了 DCF-Net 在实际应用中的潜力。

关键词

引用

@article{arxiv.2502.08191,
  title  = {DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions},
  author = {Ke Xue and Rongfei Fan and Shanping Yu and Chang Sun and Jianping An},
  journal= {arXiv preprint arXiv:2502.08191},
  year   = {2025}
}