相位感知深度语音增强:关键在于帧长
音频与语音处理
2022-10-26 v2 机器学习
声音
摘要
语音处理中的算法延迟主要由用于傅里叶分析的帧长决定,而这反过来限制了以幅度为中心的方法所能达到的性能。由于先前的研究表明相位的重要性随帧长减小而增长,本工作对现代基于深度神经网络(DNN)的语音增强中相位与幅度在不同帧长下的贡献进行了系统性研究。结果表明,当使用短帧时,DNN 能够成功估计相位,且整体性能与使用较长帧时相似或更好。因此有趣的是,现代相位感知 DNN 能够实现低延迟且高质量的语音增强。
引用
@article{arxiv.2203.16222,
title = {Phase-Aware Deep Speech Enhancement: It's All About The Frame Length},
author = {Tal Peer and Timo Gerkmann},
journal= {arXiv preprint arXiv:2203.16222},
year = {2022}
}
备注
The following article has been accepted by JASA Express Letters. After it is published, it will be found at http://asa.scitation.org/journal/jel