Transformer模型的训练技巧
计算与语言
2018-05-03 v2
摘要
本文描述了我们使用近期Tensor2Tensor框架与Transformer序列到序列模型(Vaswani et al., 2017)进行神经机器翻译的实验。我们考察了一些影响最终翻译质量、内存使用、训练稳定性和训练时间的关键参数,并在每个实验结束时为同行研究者给出一组建议。除确认“更多数据与更大模型”的普遍准则外,我们探讨了向多GPU的扩展,并针对批大小、学习率、预热步数、最大句子长度和检查点平均提供了改进训练的实用技巧。我们希望我们的观察能使他人在特定的硬件与数据限制下获得更好的结果。
引用
@article{arxiv.1804.00247,
title = {Training Tips for the Transformer Model},
author = {Martin Popel and Ondřej Bojar},
journal= {arXiv preprint arXiv:1804.00247},
year = {2018}
}
备注
This is the version published in PBML (https://ufal.mff.cuni.cz/pbml/110/art-popel-bojar.pdf)