中文

用于训练深度神经网络声学模型的房间模拟器的高效实现

声音 2019-01-03 v2 音频与语音处理 信号处理

摘要

在本文中,我们描述了如何高效实现声学房间模拟器以生成大规模模拟数据用于训练深度神经网络。尽管[1]中的 Google Room Simulator 已通过对生成远场训练集来降低远场应用的词错误率(WERs)而被证明相当有效,但它需要非常大尺寸的快速傅里叶变换(FFTs)的极大量计算。[1]中的 Room Simulator 在我们 CPU + 图形处理单元(GPU)训练架构[2]中约占中央处理单元(CPU)使用量的 80%。在本工作中,我们使用开源 FFTW3 库实现了一种基于高效重叠相加(OLA)的滤波。此外,我们研究了房间脉冲响应(RIR)长度的影响。通过实验,我们得出结论:可将功率低于最大功率 20 dB 以下的 RIR 尾部截断而不损失语音识别精度。然而,我们观察到将 RIR 尾部截断超过此阈值会损害重录测试集的语音识别精度。利用这些方法,我们能将 CPU/GPU 训练架构中房间模拟器部分的 CPU 使用量降至 9.69%。性能分析结果显示,我们在单台机器上获得 22.4 倍加速,在 Google 分布式训练基础设施上获得 37.3 倍加速。

关键词

引用

@article{arxiv.1712.03439,
  title  = {Efficient Implementation of the Room Simulator for Training Deep Neural Network Acoustic Models},
  author = {Chanwoo Kim and Ehsan Variani and Arun Narayanan and Michiel Bacchiani},
  journal= {arXiv preprint arXiv:1712.03439},
  year   = {2019}
}

备注

Published at INTERSPEECH 2018. (https://www.isca-speech.org/archive/Interspeech_2018/abstracts/2566.html)