中文

基于生成对抗网络利用音频指纹特征进行语音增强的研究

音频与语音处理 2020-07-28 v1 机器学习 声音

摘要

基于学习的语音增强方法的兴起,重新激发了对鲁棒可靠训练特征的需求,这类特征能紧凑表示语音信号并保留其关键信息。时频域特征,如短时傅里叶变换(STFT)与梅尔频率倒谱系数(MFCC),在许多方法中更受青睐。虽然 MFCC 提供了紧凑表示,但其忽略了各梅尔尺度子带中能量的动态与分布。在本工作中,实现并测试了一种基于生成对抗网络(GAN)的语音增强系统,其使用了由 MFCC 与归一化谱子带质心(NSSC)得到的音频指纹(AFP)特征组合。NSSC 捕获语音共振峰位置,并以关键方式补充 MFCC。在包含不同说话人与噪声类型的实验中,采用所提 AFP 特征组合的基于 GAN 的语音增强取得了最佳客观性能,同时降低了内存需求与训练时间。

关键词

引用

@article{arxiv.2007.13258,
  title  = {On the Use of Audio Fingerprinting Features for Speech Enhancement with Generative Adversarial Network},
  author = {Farnood Faraji and Yazid Attabi and Benoit Champagne and Wei-Ping Zhu},
  journal= {arXiv preprint arXiv:2007.13258},
  year   = {2020}
}

备注

6 pages, 2020 IEEE Workshop on Signal Processing Systems (SiPS)