中文

通过全频带与子带集成建模实现极低算法延迟与复杂度的神经语音增强

音频与语音处理 2023-04-19 v1 声音

摘要

我们提出FSB-LSTM,一种基于长短期记忆(LSTM)并集成全频带与子带(FSB)建模的新颖架构,用于短时傅里叶变换(STFT)域中的单通道与多通道语音增强。该模型维护一条信息高速公路,将过完备输入表示流经多个FSB-LSTM模块。每个FSB-LSTM模块由一个全频带块和子带块组成,全频带块用于建模所有频率上的谱-时域模式,子带块用于建模各子带内的模式,其中两个块均将下采样表示作为输入,并返回上采样的判别表示,通过残差连接加回到块输入。该模型被设计为具有低算法复杂度、小运行时缓冲和极低算法延迟,同时在噪声-混响语音增强任务上即使跳距小至22 ms也能产生强劲的增强性能。

关键词

引用

@article{arxiv.2304.08707,
  title  = {Neural Speech Enhancement with Very Low Algorithmic Latency and Complexity via Integrated Full- and Sub-Band Modeling},
  author = {Zhong-Qiu Wang and Samuele Cornell and Shukjae Choi and Younglo Lee and Byeong-Yeol Kim and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2304.08707},
  year   = {2023}
}

备注

in ICASSP 2023