基于单头注意力的序列到序列模型在Switchboard上取得最优结果
音频与语音处理
2020-10-21 v3 计算与语言
摘要
人们普遍认为,直接的序列到序列(seq2seq)语音识别模型只有在拥有大量数据(至少上千小时)用于训练时,才能与混合模型竞争。在本文中,我们展示了使用基于单头注意力、LSTM的模型,可以在Switchboard-300数据库上达到最优识别性能。使用跨语句语言模型,我们的单次通过说话人无关系统在Hub5'00的Switchboard和CallHome子集上分别达到6.4%和12.5%的词错误率(WER),且无需发音词典。虽然细致的正则化和数据增强对达到此性能水平至关重要,但在Switchboard-2000上的实验表明,没有什么比更多数据更有用。总体而言,结合各种正则化与一个简单但相当大的模型,在使用SWB-2000且没有任何外部数据资源的情况下,在Switchboard和CallHome集上分别取得了4.7%和7.8%的WER,达到了新的最优水平。
引用
@article{arxiv.2001.07263,
title = {Single headed attention based sequence-to-sequence model for state-of-the-art results on Switchboard},
author = {Zoltán Tüske and George Saon and Kartik Audhkhasi and Brian Kingsbury},
journal= {arXiv preprint arXiv:2001.07263},
year = {2020}
}
备注
5 pages, 2 figures