基于自监督学习与复周期一致性的单通道语音增强
声音
2021-12-22 v1 音频与语音处理
摘要
近来,自监督学习(SSL)技术被引入以解决单通道语音增强问题。由于大多 SSL 方法缺乏利用干净相位信息,其增强性能受限。因此,本文提出一种基于相位感知自监督学习的单通道语音增强方法。在基础自编码器(FAE)的两个解码器中,仅使用有限集的干净语音信号独立地研究幅度与相位的潜在表示。随后,下游自编码器(DAE)利用大量未见的混合信号学习干净语音与混合表示之间的共享潜在空间。提出一种复周期一致性(CCC)机制,以最小化幅度域与相位域之间的重构损失。此外,注意到若将语音特征提取为多分辨率谱,则可利用分布于不同尺度谱中的期望信息以进一步提升性能。使用 NOISEX 与 DAPS 语料库生成含不同干扰的混合信号以评估所提方法的有效性。需强调,送入 FAE 与 DAE 的干净语音与混合信号并非配对。消融与对比实验结果均表明,所提方法明显优于当前最优方法。
引用
@article{arxiv.2112.11142,
title = {Self-Supervised Learning based Monaural Speech Enhancement with Complex-Cycle-Consistent},
author = {Yi Li and Yang Sun and Syed Mohsen Naqvi},
journal= {arXiv preprint arXiv:2112.11142},
year = {2021}
}