SE Territory:单通道语音增强遇见固定虚拟感知空间映射
音频与语音处理
2024-03-05 v2
摘要
单通道语音增强近期取得显著进展,但其性能受限于单麦克风可用的有限空间线索。为克服该限制,我们引入一种策略,将单通道语音映射至固定仿真空间,以更好区分目标语音与噪声。具体地,我们提出 SE-TerrNet,一种新颖的单通道语音增强模型,其通过两阶段多任务学习框架具备虚拟双耳语音映射网络。第一阶段,利用有监督语音映射块将单通道含噪输入投影至虚拟空间,生成双耳表示。这些块通过理想双耳房间脉冲响应从单通道输入合成双耳含噪语音。合成输出将语音与噪声源分配至感知空间内的固定方向。第二阶段,聚合第一阶段获得的双耳特征。该聚合旨在通过中间融合模块减小映射双耳特征与原始单通道特征间的模式差异。此外,该阶段利用交叉注意力捕获注入的虚拟空间信息,以提升目标语音提取。实证研究表明虚拟空间线索对增强单通道语音增强的有效性。所提 SE-TerrNet 在语音质量与可懂度上均显著超越近期单通道语音增强方法。
引用
@article{arxiv.2311.01679,
title = {SE Territory: Monaural Speech Enhancement Meets the Fixed Virtual Perceptual Space Mapping},
author = {Xinmeng Xu and Yuhong Yang and Weiping Tu},
journal= {arXiv preprint arXiv:2311.01679},
year = {2024}
}