中文

基于球谐函数对空间线索进行分层建模的多通道语音增强方法

声音 2023-09-20 v1 音频与语音处理

摘要

多通道语音增强利用来自多个麦克风的空间信息来提取目标语音。然而,大多数现有方法并未显式建模空间线索,而是依赖从多通道频谱中的隐式学习。为了更好地利用空间信息,我们提出通过对多通道输入应用球谐变换(SHT)来显式引入空间建模。具体而言,引入了一种分层框架:先估计捕获更宽泛空间模式的低阶谐波,再与高阶谐波结合以递归地预测更精细的空间细节。在 TIMIT 上的实验表明,所提方法能有效恢复目标空间模式,并以更少的参数与计算量取得优于基线模型的性能。显式地分层建模空间信息实现了更有效的多通道语音增强。

关键词

引用

@article{arxiv.2309.10393,
  title  = {Hierarchical Modeling of Spatial Cues via Spherical Harmonics for Multi-Channel Speech Enhancement},
  author = {Jiahui Pan and Shulin He and Hui Zhang and Xueliang Zhang},
  journal= {arXiv preprint arXiv:2309.10393},
  year   = {2023}
}