基于自监督嵌入的跨域特征融合与多头注意力语音增强网络 BSS-CFFMA
音频与语音处理
2024-08-14 v1 人工智能
摘要
语音自监督学习(SSL)在多个下游任务中已取得最先进的(SOTA)性能。然而,其在语音增强(SE)任务中的应用尚不成熟,提供了改进的空间。在本研究中,我们提出了一种新型跨域特征融合与多头注意力语音增强网络 BSS-CFFMA,它利用自监督嵌入。BSS-CFFMA 由多尺度跨域特征融合(MSCFF)模块和残差混合多头注意力(RHMA)模块组成。MSCFF 模块有效整合跨域特征,促进丰富声学信息的提取。RHMA 模块作为主要增强模块,利用三种不同的注意力模块捕获多样的注意力表示并估计高质量语音信号。我们在 VoiceBank-DEMAND 数据集上通过对比和消融实验评估了 BSS-CFFMA 的性能,取得了 SOTA 结果。此外,我们从 WHAMR! 数据集中选取三种类型的数据——该数据集专门为语音增强任务设计——来评估 BSS-CFFMA 在仅去噪、仅去混响以及同时去噪和去混响等任务中的能力。本研究首次探索了基于自监督嵌入的语音增强方法在涉及去混响和同时去噪与去混响的复杂任务中的有效性。BSS-CFFMA 的演示实现可在线获取。
引用
@article{arxiv.2408.06851,
title = {BSS-CFFMA: Cross-Domain Feature Fusion and Multi-Attention Speech Enhancement Network based on Self-Supervised Embedding},
author = {Alimjan Mattursun and Liejun Wang and Yinfeng Yu},
journal= {arXiv preprint arXiv:2408.06851},
year = {2024}
}
备注
Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2024