中文

SICRN:通过状态空间模型和原位卷积技术推进语音增强

音频与语音处理 2024-02-23 v1 声音

摘要

语音增强旨在改善语音质量和可理解性,尤其是在背景噪声降低语音信号的嘈杂环境中。当前,深度学习方法在语音增强方面取得了很大成功,例如代表性的卷积循环神经网络(CRN)及其变体。然而,CRN 通常采用连续的下采样和上采样卷积进行频率建模,这会破坏信号在频率上的固有结构。此外,卷积层缺乏时序建模能力。为解决这些问题,我们提出了一个创新模块,将状态空间模型与原位卷积(SIC)组合,用于取代 CRN 中的常规卷积,称为 SICRN。具体而言,双路径多维状态空间模型捕获全局频率依赖性和长期时序依赖性。同时,使用 2D 原位卷积捕获局部结构,放弃下采样和上采样。在公开的 INTERSPEECH 2020 DNS 挑战数据集上进行系统评估,证明 SICRN 的有效性。与强大的基线方法相比,SICRN 在模型参数、计算量和算法延迟方面具有优势,同时实现了接近 SOTA 的性能。该提出的 SICRN 在改进语音增强方面显示出巨大的潜力。

关键词

引用

@article{arxiv.2402.14225,
  title  = {SICRN: Advancing Speech Enhancement through State Space Model and Inplace Convolution Techniques},
  author = {Changjiang Zhao and Shulin He and Xueliang Zhang},
  journal= {arXiv preprint arXiv:2402.14225},
  year   = {2024}
}