通过知识蒸馏为单通道语音增强注入空间信息
音频与语音处理
2022-12-05 v1 声音
摘要
单通道语音增强(SE)利用单个麦克风的录音,为 SE 任务提供了一种通用且经济高效的方法。然而,由于单通道 SE 方法无法从单通道录音中提取空间信息,其性能落后于多通道 SE,这极大限制了其应用场景。为解决此问题,我们将空间信息注入单通道 SE 模型,并提出一种知识蒸馏策略,使单通道 SE 模型能从双耳 SE 模型学习双耳语音特征,从而使单通道 SE 模型在低信噪比(SNR)条件下能够重建具有更高可懂度与质量的增强语音。大量实验表明,我们所提出的通过知识蒸馏注入空间信息的单通道 SE 模型,以更少参数对其他单通道 SE 模型取得了优越性能。
引用
@article{arxiv.2212.01012,
title = {Injecting Spatial Information for Monaural Speech Enhancement via Knowledge Distillation},
author = {Xinmeng Xu and Weiping Tu and Yuhong Yang},
journal= {arXiv preprint arXiv:2212.01012},
year = {2022}
}
备注
Submitted to ICASSP 2023