中文

基于Transformer的掩码生成与感知对比度拉伸的语音增强方法

声音 2024-08-12 v1 音频与语音处理

摘要

自监督表示学习(SSL)在多个下游语音任务上取得了最先进的结果,但基于SSL的语音增强(SE)解决方案仍落后。为解决这一问题,我们利用了三个主要思想:(i)基于Transformer的掩码生成,(ii)一致性保持损失,以及(iii)感知对比度拉伸(PCS)。具体而言,引入了利用注意力机制的Conformer层,以有效建模帧级表示并获得用于SE的理想比率掩码(IRM)。此外,我们在损失函数中引入了一致性,该函数处理输入以考虑从频谱图重建信号的不一致性效应。最后,采用PCS根据感知重要性改善输入和目标特征的对比度。在VoiceBank-DEMAND任务上的评估表明,所提出的解决方案在多个客观指标上优于先前基于SSL的SE解决方案,获得了3.54的SOTA PESQ分数。

关键词

引用

@article{arxiv.2408.04773,
  title  = {Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement},
  author = {Muhammad Salman Khan and Moreno La Quatra and Kuo-Hsuan Hung and Szu-Wei Fu and Sabato Marco Siniscalchi and Yu Tsao},
  journal= {arXiv preprint arXiv:2408.04773},
  year   = {2024}
}