面向高效端到端语音识别的仿生神经网络研究
音频与语音处理
2021-11-05 v2 机器学习
神经与进化计算
定量方法
摘要
自动语音识别(ASR)是一种使程序能够将人类语音处理为书面文本的能力。人工智能(AI)的最新进展催生了基于深度神经网络的高精度 ASR 系统,例如循环神经网络转导器(RNN-T)。然而,这些方法的核心组件与所执行的操作偏离了强大的生物对应物,即人脑。另一方面,当前基于脉冲神经网络(SNNs)的仿生 ASR 模型的发展在准确性方面落后,并且主要关注小规模应用。在这项工作中,我们重新审视了将生物学上合理的模型引入深度学习,并通过借鉴大脑中多样的神经与突触动力学大幅增强了其能力。特别地,我们引入了模拟轴体-胞体和轴体-轴突突触的神经连接概念。基于此,我们提出了具有丰富神经-突触动力学的新型深度学习单元,并将其集成到 RNN-T 架构中。我们首次证明,大规模 ASR 模型的生物学真实实现能够取得与现有深度学习模型相竞争的性能水平。具体而言,我们展示了此类实现具有若干优势,例如降低的计算成本与更低的延迟,这对语音识别应用至关重要。
引用
@article{arxiv.2110.02743,
title = {Towards efficient end-to-end speech recognition with biologically-inspired neural networks},
author = {Thomas Bohnstingl and Ayush Garg and Stanisław Woźniak and George Saon and Evangelos Eleftheriou and Angeliki Pantazi},
journal= {arXiv preprint arXiv:2110.02743},
year = {2021}
}
备注
Accepted at the Efficient Natural Language and Speech Processing workshop at NeurIPS 2021