中文

用于长程序列建模的压缩Transformer

机器学习 2019-11-14 v1 机器学习

摘要

我们提出压缩Transformer(Compressive Transformer),一种通过压缩过往记忆以实现长程序列学习的注意力序列模型。我们发现压缩Transformer在WikiText-103与Enwik8基准上取得了最先进的语言建模结果,分别达到17.1 ppl与0.97 bpc。我们还发现它能有效建模高频语音,并可用作强化学习(RL)的记忆机制,在一个物体匹配任务上得到展示。为促进长程序列学习这一领域,我们提出了一种源自书籍的新开放词表语言建模基准PG-19。

关键词

引用

@article{arxiv.1911.05507,
  title  = {Compressive Transformers for Long-Range Sequence Modelling},
  author = {Jack W. Rae and Anna Potapenko and Siddhant M. Jayakumar and Timothy P. Lillicrap},
  journal= {arXiv preprint arXiv:1911.05507},
  year   = {2019}
}

备注

19 pages, 6 figures, 10 tables