面向语音增强的基于音素的分布正则化
音频与语音处理
2021-04-09 v1 声音
摘要
现有语音增强方法主要在信号级或时频域将语音从噪声中分离,很少关注受损信号的语义信息。本文旨在通过提取音素身份以辅助语音增强来弥补这一差距。具体地,我们提出一种基于音素的分布正则化(PbDr)用于语音增强,其以条件方式将逐帧音素信息融入语音增强网络。由于不同音素在频率上总导致不同特征分布,我们提出通过音素分类向量学习一对参数(即缩放与偏置)来调制语音增强网络。该调制参数对不仅包含逐帧条件,也包含逐频率条件,从而将特征有效映射至音素相关分布。以此方式,我们显式地通过识别向量正则化语音增强特征。在公开数据集上的实验表明,所提PbDr模块不仅能提升语音增强的感知质量,也能提升ASR系统对增强语音的识别准确率。该PbDr模块可轻易嵌入其他语音增强网络中。
关键词
引用
@article{arxiv.2104.03759,
title = {Phoneme-based Distribution Regularization for Speech Enhancement},
author = {Yajing Liu and Xiulian Peng and Zhiwei Xiong and Yan Lu},
journal= {arXiv preprint arXiv:2104.03759},
year = {2021}
}
备注
ICASSP 2021 (Accepted)