引导式语音增强网络
音频与语音处理
2023-03-15 v1 机器学习
声音
摘要
高质量的语音采集因语音通信与人机接口方面的原因已被广泛研究。为提升采集性能,我们常可见多麦克风语音增强技术部署于各类设备。多麦克风语音增强问题常被分解为两个解耦步骤:提供空间滤波的波束成形器,以及清理波束成形器输出的单通道语音增强模型。本工作中,我们提出一种语音增强方案,将原始麦克风输出与波束成形器输出共同作为机器学习模型的输入。我们设计了一种简单而有效的训练策略,使模型通过对比两种输入从波束成形器的线索中学习,并在空间抑制能力上大幅提升,同时完成去噪与去混响的通用任务。所提方案利用经典空间滤波算法而非与之竞争。按设计,波束成形器模块可单独选取,无需大量数据针对特定外形尺寸优化;网络模型可视为独立模块,与麦克风阵列高度可迁移无关。我们将方案中的机器学习模块命名为 GSENet,即 Guided Speech Enhancement Network(引导式语音增强网络)的缩写。我们在多麦克风设备采集的真实世界数据上展示了其在抑制噪声与干扰语音方面的有效性。
引用
@article{arxiv.2303.07486,
title = {Guided Speech Enhancement Network},
author = {Yang Yang and Shao-Fu Shih and Hakan Erdogan and Jamie Menjay Lin and Chehung Lee and Yunpeng Li and George Sung and Matthias Grundmann},
journal= {arXiv preprint arXiv:2303.07486},
year = {2023}
}
备注
Accepted to ICASSP 2023