RETURNN作为通用灵活神经工具包及其在翻译与语音识别中的应用
神经与进化计算
2019-08-06 v2 人工智能
计算与语言
摘要
我们比较了RETURNN在翻译注意力模型上因快速CUDA LSTM内核和快速纯TensorFlow束搜索解码器而具备的快速训练与解码速度。我们展示了一种用于循环注意力模型的逐层预训练方案可带来超过1%的绝对BLEU提升,并允许训练更深的循环编码器网络。给出了关于最大期望BLEU训练的初步有前景结果。我们能够训练用于翻译的最先进模型以及用于语音识别的端到端模型,并展示在WMT 2017和Switchboard上的结果。RETURNN的灵活性允许快速的研究反馈循环以试验替代架构,其通用性允许在广泛应用上使用它。
引用
@article{arxiv.1805.05225,
title = {RETURNN as a Generic Flexible Neural Toolkit with Application to Translation and Speech Recognition},
author = {Albert Zeyer and Tamer Alkhouli and Hermann Ney},
journal= {arXiv preprint arXiv:1805.05225},
year = {2019}
}
备注
accepted as demo paper on ACL 2018