中文

SpeakerBeam-SS:基于轻量级 Conv-TasNet 和状态空间建模的实时目标说话人抽取

音频与语音处理 2024-07-03 v1 声音 信号处理

摘要

实时目标说话人抽取(TSE)旨在以流式方式从多个说话人混合语音中抽取出所需说话人的语音。实现实时 TSE 具有挑战性,因为其计算复杂度必须降低以提供实时操作。本工作引入一种基于状态空间建模(SSM)的 Conv-TasNet 架构,该架构已显示出有效建模长期依赖性。凭借 SSM,减少了 Conv-TasNet 中捕获时序依赖性所需的稀释卷积层的数量,从而降低了模型复杂度。我们还进一步扩大了卷积(TasNet)前端编码器的窗口长度和移位量,以进一步降低计算成本;通过对前端编码器进行超参数化来补偿性能下降。该方法在保持性能的同时,将相对于传统因果 Conv-TasNet 基于 TSE 的实时因子降低了 78%。

关键词

引用

@article{arxiv.2407.01857,
  title  = {SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling},
  author = {Hiroshi Sato and Takafumi Moriya and Masato Mimura and Shota Horiguchi and Tsubasa Ochiai and Takanori Ashihara and Atsushi Ando and Kentaro Shinayama and Marc Delcroix},
  journal= {arXiv preprint arXiv:2407.01857},
  year   = {2024}
}

备注

Accepted to Interspeech 2024