基于球谐函数对空间线索进行分层建模的多通道语音增强方法
声音
2023-09-20 v1 音频与语音处理
摘要
多通道语音增强利用来自多个麦克风的空间信息来提取目标语音。然而,大多数现有方法并未显式建模空间线索,而是依赖从多通道频谱中的隐式学习。为了更好地利用空间信息,我们提出通过对多通道输入应用球谐变换(SHT)来显式引入空间建模。具体而言,引入了一种分层框架:先估计捕获更宽泛空间模式的低阶谐波,再与高阶谐波结合以递归地预测更精细的空间细节。在 TIMIT 上的实验表明,所提方法能有效恢复目标空间模式,并以更少的参数与计算量取得优于基线模型的性能。显式地分层建模空间信息实现了更有效的多通道语音增强。
引用
@article{arxiv.2309.10393,
title = {Hierarchical Modeling of Spatial Cues via Spherical Harmonics for Multi-Channel Speech Enhancement},
author = {Jiahui Pan and Shulin He and Hui Zhang and Xueliang Zhang},
journal= {arXiv preprint arXiv:2309.10393},
year = {2023}
}