TaylorBeamformer:基于泰勒逼近理论学习全神经波束形成器用于多通道语音增强
声音
2022-03-17 v2 音频与语音处理
摘要
尽管现有的端到端波束形成器在各种前端语音处理任务中取得了令人印象深刻的性能,它们通常将整个过程封装进黑箱,因而缺乏充分的可解释性。作为填补这一空白的尝试,我们提出了一种受泰勒逼近理论启发的新型神经波束形成器,称为 TaylorBeamformer,用于多通道语音增强。核心思想是恢复过程可表述为输入混合邻域中的空间滤波。基于此,我们将其分解为 0 阶非导数项与高阶导数项的叠加,其中前者充当空间滤波器,后者被视为残差噪声消除器以进一步改善语音质量。为实现端到端训练,我们用可训练网络替代导数运算,从而能从训练数据中学习。基于 LibriSpeech 的合成数据集上进行了大量实验,结果表明所提方法相对于先前先进基线表现更优。
引用
@article{arxiv.2203.07195,
title = {TaylorBeamformer: Learning All-Neural Beamformer for Multi-Channel Speech Enhancement from Taylor's Approximation Theory},
author = {Andong Li and Guochen Yu and Chengshi Zheng and Xiaodong Li},
journal= {arXiv preprint arXiv:2203.07195},
year = {2022}
}
备注
Submitted to Interspeech2022