DeepFilterNet2:面向嵌入式设备全频带音频的实时语音增强
音频与语音处理
2022-05-12 v1 机器学习
声音
信号处理
摘要
基于深度学习的语音增强已取得巨大进展,近期也扩展至全频带音频(48 kHz)。然而,许多方法计算复杂度较高,且由于时间卷积或注意力机制需要较大的时间缓冲才能实时使用。这两者使得此类方法在嵌入式设备上不可行。本工作进一步扩展DeepFilterNet,其利用语音的谐波结构以实现高效的语音增强(SE)。在训练流程、数据增强和网络结构上的若干优化带来了最先进的SE性能,同时将笔记本Core-i5 CPU上的实时因子降低至0.04。这使得该算法可应用于嵌入式设备上的实时运行。DeepFilterNet框架可基于开源许可获取。
引用
@article{arxiv.2205.05474,
title = {DeepFilterNet2: Towards Real-Time Speech Enhancement on Embedded Devices for Full-Band Audio},
author = {Hendrik Schröter and Alberto N. Escalante-B. and Tobias Rosenkranz and Andreas Maier},
journal= {arXiv preprint arXiv:2205.05474},
year = {2022}
}
备注
Submitted to IWAENC 2022