Cleanformer:一种用于智能音箱 ASR 的阵列配置不变多通道神经增强前端
音频与语音处理
2023-05-05 v4 声音
摘要
本工作介绍了 Cleanformer,一种用于自动语音识别(ASR)的流式多通道基于神经网络的增强前端。该模型具有基于 conformer 的架构,以原始信号与增强信号各一个通道作为输入,并利用自注意力推导时频掩码。增强输入由一种称为 Speech Cleaner 的多通道自适应噪声消除算法生成,该算法利用噪声上下文来推导其滤波器抽头。时频掩码被应用于含噪输入以产生用于 ASR 的增强输出特征。文中给出了在基于语音和非基于语音噪声的仿真与重录数据集上的详细评估,结果表明在使用大规模最先进 ASR 模型时词错误率(WER)显著降低。还将显示其显著优于使用具有理想导向的波束成形器的增强方法。该增强模型与麦克风数量和阵列配置无关,因此可用于不同麦克风阵列而无需重新训练。结果表明,性能随麦克风数量增加而提升,最多至 4 个,且每额外增加一个麦克风带来的边际收益递减。具体而言,在 -6dB 的信噪比下,两种噪声条件下均显示出约 80% 的相对 WER 提升。
引用
@article{arxiv.2204.11933,
title = {Cleanformer: A multichannel array configuration-invariant neural enhancement frontend for ASR in smart speakers},
author = {Joseph Caroselli and Arun Narayanan and Nathan Howard and Tom O'Malley},
journal= {arXiv preprint arXiv:2204.11933},
year = {2023}
}
备注
Accepted to ICASSP 2023