中文

相位感知深度语音增强:关键在于帧长

音频与语音处理 2022-10-26 v2 机器学习 声音

摘要

语音处理中的算法延迟主要由用于傅里叶分析的帧长决定,而这反过来限制了以幅度为中心的方法所能达到的性能。由于先前的研究表明相位的重要性随帧长减小而增长,本工作对现代基于深度神经网络(DNN)的语音增强中相位与幅度在不同帧长下的贡献进行了系统性研究。结果表明,当使用短帧时,DNN 能够成功估计相位,且整体性能与使用较长帧时相似或更好。因此有趣的是,现代相位感知 DNN 能够实现低延迟且高质量的语音增强。

关键词

引用

@article{arxiv.2203.16222,
  title  = {Phase-Aware Deep Speech Enhancement: It's All About The Frame Length},
  author = {Tal Peer and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2203.16222},
  year   = {2022}
}

备注

The following article has been accepted by JASA Express Letters. After it is published, it will be found at http://asa.scitation.org/journal/jel