中文

面向机器耳的多通道语音降噪

音频与语音处理 2022-02-18 v1 声音 信号处理

摘要

本文描述了一种用于机器耳的语音降噪系统,旨在改善噪声环境下的语音可懂度和整体听音体验。我们使用放置在双耳两侧的一对麦克风阵列录制了约 100 小时带混响和中等环境噪声的音频数据,然后混合声音录音以模拟不利的声学场景。随后,我们在混合录音上训练了一个多通道语音降噪网络(MCSDN)。为改进训练,我们采用一种无监督方法——复角中心高斯混合模型(cACGMM),从含噪录音中获取更干净的语音作为学习目标。我们在推理阶段提出了 MCSDN-波束成形-MCSDN 框架。主观评价结果表明,cACGMM 改善了训练数据,带来了更好的噪声抑制和用户偏好,且整个系统改善了噪声情境下的可懂度与听音体验。

关键词

引用

@article{arxiv.2202.08793,
  title  = {Multi-Channel Speech Denoising for Machine Ears},
  author = {Cong Han and E. Merve Kaya and Kyle Hoefer and Malcolm Slaney and Simon Carlile},
  journal= {arXiv preprint arXiv:2202.08793},
  year   = {2022}
}

备注

Accepted to ICASSP 2022