所有信息皆必要:通过对比学习融合语音正负面信息用于语音增强
音频与语音处理
2023-04-27 v1
摘要
单通道语音增强(SE)因不可逆的退化过程为一病态问题。近期实现 SE 任务的方法仅依赖正面信息,例如真值语音与语音相关特征。与上述不同,我们观察到负面信息,如原始语音混合与语音无关特征,对指导 SE 模型训练过程颇具价值。本研究中,我们提出一种融合语音正面与负面信息以提升 SE 性能的 SE 模型,采用对比学习,其中包含两项创新。(1)我们设计了一个协作模块(CM),其包含两部分:通过对比学习分离相关与无关特征的对比注意力,以及以可学习自适应方式建立两类语音特征间关联的交互注意力。(2)我们提出基于对比学习的对比正则化(CR),通过整合自监督模型,在表示空间中使估计语音拉近干净语音、推远带噪语音。我们将所提带 CM 与 CR 的 SE 网络称为 CMCR-Net。实验结果表明,我们的 CMCR-Net 取得了与近期方法相当乃至更优的性能。
引用
@article{arxiv.2304.13439,
title = {All Information is Necessary: Integrating Speech Positive and Negative Information by Contrastive Learning for Speech Enhancement},
author = {Xinmeng Xu and Weiping Tu and Chang Han and Yuhong Yang},
journal= {arXiv preprint arXiv:2304.13439},
year = {2023}
}