中文

DeepFilterNet2:面向嵌入式设备全频带音频的实时语音增强

音频与语音处理 2022-05-12 v1 机器学习 声音 信号处理

摘要

基于深度学习的语音增强已取得巨大进展,近期也扩展至全频带音频(48 kHz)。然而,许多方法计算复杂度较高,且由于时间卷积或注意力机制需要较大的时间缓冲才能实时使用。这两者使得此类方法在嵌入式设备上不可行。本工作进一步扩展DeepFilterNet,其利用语音的谐波结构以实现高效的语音增强(SE)。在训练流程、数据增强和网络结构上的若干优化带来了最先进的SE性能,同时将笔记本Core-i5 CPU上的实时因子降低至0.04。这使得该算法可应用于嵌入式设备上的实时运行。DeepFilterNet框架可基于开源许可获取。

关键词

引用

@article{arxiv.2205.05474,
  title  = {DeepFilterNet2: Towards Real-Time Speech Enhancement on Embedded Devices for Full-Band Audio},
  author = {Hendrik Schröter and Alberto N. Escalante-B. and Tobias Rosenkranz and Andreas Maier},
  journal= {arXiv preprint arXiv:2205.05474},
  year   = {2022}
}

备注

Submitted to IWAENC 2022