中文

面向神经机器翻译的基于能力的课程学习

计算与语言 2019-03-27 v2 机器学习 机器学习

摘要

当前 SOTA 的 NMT 系统使用大型神经网络,不仅训练缓慢,而且通常需要许多启发式方法和优化技巧,例如特定的学习率调度和大批量大小。这是不可取的,因为它需要广泛的超参数调优。在本文中,我们提出了一个用于 NMT 的课程学习框架,该框架减少了训练时间,降低了对特定启发式方法或大批量大小的需求,并带来了整体更好的性能。我们的框架包含一种原则性的方法,基于样本的估计难度和模型的当前能力,决定在训练期间的不同时间向模型展示哪些训练样本。以这种方式过滤训练样本可以防止模型陷入糟糕的局部最优,使其比均匀采样训练样本的常见方法收敛更快并达到更好的解。此外,所提方法只需修改现有 NMT 模型的输入数据管道即可轻松应用。我们表明,我们的框架可以帮助改善循环神经网络模型和 Transformer 的训练时间和性能,实现高达 70% 的训练时间减少,同时获得高达 2.2 BLEU 的准确率提升。

关键词

引用

@article{arxiv.1903.09848,
  title  = {Competence-based Curriculum Learning for Neural Machine Translation},
  author = {Emmanouil Antonios Platanios and Otilia Stretcu and Graham Neubig and Barnabas Poczos and Tom M. Mitchell},
  journal= {arXiv preprint arXiv:1903.09848},
  year   = {2019}
}