ChannelAugment:通过输入通道随机化训练提升多通道ASR的泛化能力
音频与语音处理
2021-09-24 v1 机器学习
摘要
端到端(E2E)多通道ASR系统通过联合训练多通道前端与ASR模型,在远场ASR任务中展现出最优性能。此类系统的主要局限在于通常使用固定阵列几何形状的数据训练,当测试采用不同阵列时会导致精度下降。这使得实际部署具有挑战性,因为为各种阵列配置重新训练并部署不同模型成本高昂。为此,我们提出一种简单有效的数据增强技术,其在训练期间随机丢弃多通道音频输入中的通道,以提升测试时对多种阵列配置的鲁棒性。我们将该技术称为ChannelAugment,以区别于SpecAugment(SA)——后者丢弃单通道输入音频的时间和/或频率分量。我们将ChannelAugment应用于空间滤波(SF)和最小方差无失真响应(MVDR)神经波束成形方法。对于SF,我们在采用不同麦克风数量的各种阵列配置上观察到10.6%的WER提升。对于MVDR,我们实现了74%的训练时间缩减且不造成识别精度下降。
引用
@article{arxiv.2109.11225,
title = {ChannelAugment: Improving generalization of multi-channel ASR by training with input channel randomization},
author = {Marco Gaudesi and Felix Weninger and Dushyant Sharma and Puming Zhan},
journal= {arXiv preprint arXiv:2109.11225},
year = {2021}
}
备注
To appear in ASRU 2021