中文

基于 Tensor Train 分解在 TensorFlow (T3F) 上训练神经机器翻译(NMT)模型

机器学习 2019-11-06 v1 计算与语言 机器学习

摘要

我们使用 t3f 库在 TensorFlow 神经机器翻译(NMT)模型中实现了一个 Tensor Train 层。我们在 IWSLT 英越 '15 和 WMT 德英 '16 数据集上以学习率 {0.0004,0.0008,0.0012}\in \{0.0004,0.0008,0.0012\}、最大秩 {2,4,8,16}\in \{2,4,8,16\} 和一系列核心维度进行训练运行。我们以基准运行获得的 24.0 的 BLEU 测试分数为目标。对于 IWSLT 英越训练,我们使用核心维度 (2,2,256)×(2,2,512)(2, 2, 256) \times (2, 2, 512)、学习率 0.0012 以及秩分布 (1,4,4,1)(1,4,4,1)(1,4,16,1)(1,4,16,1) 分别获得了 24.0/21.9 和 24.2/21.9 的 BLEU 测试/验证分数。这些运行分别使用了基准运行 113% 和 397% 的浮点运算量。我们发现,在所调查的参数中,较高的学习率和更“矩形”的核心维度通常产生更高的 BLEU 分数。对于 WMT 德英数据集,我们使用核心维度 (4,4,128)×(4,4,256)(4, 4, 128) \times (4, 4, 256)、学习率 0.0012 和秩分布 (1,2,2,1)(1,2,2,1) 获得了 24.0/23.8 的 BLEU 分数。我们讨论了 Tensor Train 分解在其他 NMT 模型上未来优化和应用的潜力。

关键词

引用

@article{arxiv.1911.01933,
  title  = {Training Neural Machine Translation (NMT) Models using Tensor Train Decomposition on TensorFlow (T3F)},
  author = {Amelia Drew and Alexander Heinecke},
  journal= {arXiv preprint arXiv:1911.01933},
  year   = {2019}
}

备注

10 pages, 2 tables