结合二维卷积时频域特征与预训练声学模型的多通道语音增强
声音
2021-09-27 v3 音频与语音处理
信号处理
摘要
我们提出了一种多通道语音增强方法,该方法在多任务学习范式中采用了一种新颖的两阶段特征融合方法和预训练声学模型。在第一阶段融合中,分别提取时域和频域特征。在时域中,计算多通道卷积和 (MCS) 与通道间卷积差 (ICD) 特征,并通过第一层二维卷积层进行整合;在频域中,将来自原始通道和超指向波束形成输出的对数功率谱 (LPS) 特征与第二层二维卷积层相结合。为了充分整合多通道语音的丰富信息,即时频域特征与阵列几何结构,我们在第二阶段融合中应用第三层二维卷积层以获得最终的卷积特征。此外,我们提出使用以端到端无格最大互信息准则训练的固定干净声学模型,以强制增强后的输出具有与干净波形相同的分布,从而缓解增强任务的过估计问题并约束失真。在 ConferencingSpeech 2021 挑战赛的 Task1 开发数据集上,与官方基线和近期提出的一种多通道分离方法相比,分别获得了 0.24 和 0.19 的 PESQ 改善。
引用
@article{arxiv.2107.11222,
title = {Multi-channel Speech Enhancement with 2-D Convolutional Time-frequency Domain Features and a Pre-trained Acoustic Model},
author = {Quandong Wang and Junnan Wu and Zhao Yan and Sichong Qian and Liyong Guo and Lichun Fan and Weiji Zhuang and Peng Gao and Yujun Wang},
journal= {arXiv preprint arXiv:2107.11222},
year = {2021}
}
备注
7 pages, 3 figures, accepted to APSIPA 2021, revised