面向神经语音增强的高效可训练前端
音频与语音处理
2020-02-24 v1 机器学习
神经与进化计算
声音
机器学习
摘要
许多神经语音增强与源分离系统在时频域中运行。此类模型常受益于将其短时傅里叶变换(STFT)前端设为可训练。在现有文献中,这些前端被实现为大型离散傅里叶变换矩阵,对于低计算量系统而言效率极低。我们提出一种基于蝶形机制计算快速傅里叶变换的高效可训练前端,并展示了其在低计算量神经语音增强模型中的精度与效率优势。我们还探究了使STFT窗可训练所带来的影响。
引用
@article{arxiv.2002.09286,
title = {Efficient Trainable Front-Ends for Neural Speech Enhancement},
author = {Jonah Casebeer and Umut Isik and Shrikant Venkataramani and Arvindh Krishnaswamy},
journal= {arXiv preprint arXiv:2002.09286},
year = {2020}
}
备注
5 pages, 5 figures, ICASSP 2020