全神经低延迟定向语音提取
声音
2024-07-09 v1 音频与语音处理
摘要
我们引入了一种新颖的全神经模型,用于低延迟定向语音提取。该模型使用来自预定义空间网格的到达方向(DOA)嵌入,这些嵌入被转换并融合到基于循环神经网络的语音提取模型中。这个过程使模型能够有效地从指定的 DOA 提取语音。与以往依赖手工制作的方向特征的方法不同,所提出的模型使用语音增强损失从头开始训练 DOA 嵌入,使其适用于低延迟场景。此外,它以高帧率运行,在每个输入帧中获取 DOA,从而能够在高度动态的真实场景中快速适应场景变化。我们提供了广泛的评估,以证明该模型在定向语音提取、对 DOA 失配的鲁棒性以及快速适应 DOA 突变方面的能力。
引用
@article{arxiv.2407.04879,
title = {All Neural Low-latency Directional Speech Extraction},
author = {Ashutosh Pandey and Sanha Lee and Juan Azcarreta and Daniel Wong and Buye Xu},
journal= {arXiv preprint arXiv:2407.04879},
year = {2024}
}
备注
Accepted for publication at INTERSPEECH 2024