基于低秩Transformer的轻量高效端到端语音识别
计算与语言
2020-02-17 v3 机器学习
声音
音频与语音处理
摘要
高性能深度神经网络以计算复杂度为代价,这限制了其在便携设备上的实际部署。我们提出了低秩Transformer(LRT),一种内存高效且快速的神经架构,可显著减少端到端语音识别的参数数量并提升训练与推理速度。与基线Transformer模型相比,我们的方法将网络参数量减少超过50%,并将推理时间加速约1.35倍。实验表明,与未压缩的Transformer模型相比,我们的LRT模型泛化性更好,并在验证集和测试集上均取得更低的错误率。在不使用外部语言模型或声学数据的情况下,LRT模型在端到端设定下的多个数据集上优于现有工作的模型。
引用
@article{arxiv.1910.13923,
title = {Lightweight and Efficient End-to-End Speech Recognition Using Low-Rank Transformer},
author = {Genta Indra Winata and Samuel Cahyawijaya and Zhaojiang Lin and Zihan Liu and Pascale Fung},
journal= {arXiv preprint arXiv:1910.13923},
year = {2020}
}
备注
The first two authors contributed equally to this work. Accepted as an oral presentation in ICASSP 2020