中文

SNDCNN:采用缩放指数线性单元的自归一化深度 CNN 用于语音识别

机器学习 2020-03-25 v3 计算与语言 声音 音频与语音处理 机器学习

摘要

极深 CNN 在计算机视觉与语音识别中均取得 SOTA 结果,但难以训练。训练极深 CNN 最流行的方式是将捷径连接(SC)与批归一化(BN)结合使用。受自归一化神经网络启发,我们提出基于自归一化深度 CNN(SNDCNN)的声学模型拓扑,在 ResNet-50 中移除 SC/BN 并将典型 RELU 激活替换为缩放指数线性单元(SELU)。SELU 激活使网络自归一化,并免去对捷径连接与批归一化的需求。相较 ResNet-50,我们能在将训练与推理速度均提升 60%–80% 的同时,取得相同或更低(最高 4.5% 相对)的词错误率(WER)。我们还探索其他模型推理优化方案以进一步降低生产使用的延迟。

关键词

引用

@article{arxiv.1910.01992,
  title  = {SNDCNN: Self-normalizing deep CNNs with scaled exponential linear units for speech recognition},
  author = {Zhen Huang and Tim Ng and Leo Liu and Henry Mason and Xiaodan Zhuang and Daben Liu},
  journal= {arXiv preprint arXiv:1910.01992},
  year   = {2020}
}