面向资源高效语音降噪深度神经网络的心理声学加权代价函数研究
声音
2018-01-31 v1 音频与语音处理
摘要
我们提出了一种心理声学增强的代价函数,以平衡用于语音降噪的深度神经网络的网络复杂度和感知性能。在训练网络时,我们利用添加到普通均方误差上的感知权重,以强调最可听频点的贡献,同时忽略不可听频点的误差。为生成权重,我们采用心理声学模型从干净语音频谱计算全局掩蔽阈值。然后,我们使用客观和感知声音质量指标评估我们感知引导神经网络的语音降噪性能,并在从浅而窄到深而宽的各种网络结构上测试。实验结果展示了我们的方法是一种将感知显著性注入深度神经网络操作的有效途径。特别是,简单神经网络拓扑结构中观察到的更具感知合理性的性能提升证明,所提方法可在不降低感知信号保真度的前提下,实现小型设备中的资源高效语音降噪。
引用
@article{arxiv.1801.09774,
title = {On Psychoacoustically Weighted Cost Functions Towards Resource-Efficient Deep Neural Networks for Speech Denoising},
author = {Kai Zhen and Aswin Sivaraman and Jongmo Sung and Minje Kim},
journal= {arXiv preprint arXiv:1801.09774},
year = {2018}
}
备注
5 pages, 4 figures