中文

DualSep:一种用于实时车内语音分离的轻量级双编码器卷积循环网络

音频与语音处理 2024-09-16 v1 声音

摘要

深度学习与语音激活技术的进步推动了人车交互的发展。分布式麦克风阵列能够准确捕捉来自不同语音区域乘客的声音,因此在车内场景中得到了广泛应用。然而,音频通道数量的增加,加上车内系统有限的计算资源和低延迟要求,给车内多通道语音分离带来了挑战。为了缓解这些问题,我们提出了一种级联数字信号处理 (DSP) 与神经网络 (NN) 的轻量级框架。我们利用固定波束形成 (BF) 来降低计算成本,并利用独立向量分析 (IVA) 提供空间先验。我们采用双编码器进行双分支建模,其中空间编码器捕捉空间线索,频谱编码器保留频谱信息,从而促进空间与频谱的融合。我们提出的系统同时支持流式与非流式模式。实验结果证明了所提出系统在各项指标上的优越性。在 Intel Core i7 (2.6GHz) CPU 上,该系统仅使用 0.83M 参数和 0.39 的实时因子 (RTF),即可有效将语音分离至不同的语音区域。我们的演示可在 https://honee-w.github.io/DualSep/ 获取。

关键词

引用

@article{arxiv.2409.08610,
  title  = {DualSep: A Light-weight dual-encoder convolutional recurrent network for real-time in-car speech separation},
  author = {Ziqian Wang and Jiayao Sun and Zihan Zhang and Xingchen Li and Jie Liu and Lei Xie},
  journal= {arXiv preprint arXiv:2409.08610},
  year   = {2024}
}

备注

Accepted by IEEE SLT 2024