DENSE:动态嵌入因果目标语音提取
声音
2024-12-11 v2 音频与语音处理
摘要
目标语音提取 (TSE) 专注于从混合信号中提取特定目标说话人的语音。现有的 TSE 模型通常利用静态嵌入作为提取目标说话人声音的条件。然而,静态嵌入往往无法捕捉到提取出的语音信号的上下文信息,这可能限制了模型的性能。我们提出了一种新颖的动态嵌入因果目标语音提取模型来解决这一局限性。我们的方法结合了自回归机制,基于已提取的语音生成上下文相关的嵌入,从而实现实时的帧级提取。实验结果表明,所提出的模型提高了短时客观可懂度 (STOI) 和信号失真比 (SDR),为在挑战性场景下的目标语音提取提供了一种有前景的解决方案。
引用
@article{arxiv.2409.06136,
title = {DENSE: Dynamic Embedding Causal Target Speech Extraction},
author = {Yiwen Wang and Zeyu Yuan and Xihong Wu},
journal= {arXiv preprint arXiv:2409.06136},
year = {2024}
}
备注
The experimental design and results contain errors, and I would like to withdraw the paper