SpeakerBeam-SS:基于轻量级 Conv-TasNet 和状态空间建模的实时目标说话人抽取
音频与语音处理
2024-07-03 v1 声音
信号处理
摘要
实时目标说话人抽取(TSE)旨在以流式方式从多个说话人混合语音中抽取出所需说话人的语音。实现实时 TSE 具有挑战性,因为其计算复杂度必须降低以提供实时操作。本工作引入一种基于状态空间建模(SSM)的 Conv-TasNet 架构,该架构已显示出有效建模长期依赖性。凭借 SSM,减少了 Conv-TasNet 中捕获时序依赖性所需的稀释卷积层的数量,从而降低了模型复杂度。我们还进一步扩大了卷积(TasNet)前端编码器的窗口长度和移位量,以进一步降低计算成本;通过对前端编码器进行超参数化来补偿性能下降。该方法在保持性能的同时,将相对于传统因果 Conv-TasNet 基于 TSE 的实时因子降低了 78%。
引用
@article{arxiv.2407.01857,
title = {SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling},
author = {Hiroshi Sato and Takafumi Moriya and Masato Mimura and Shota Horiguchi and Tsubasa Ochiai and Takanori Ashihara and Atsushi Ando and Kentaro Shinayama and Marc Delcroix},
journal= {arXiv preprint arXiv:2407.01857},
year = {2024}
}
备注
Accepted to Interspeech 2024