中文

MEGABYTE:用多尺度Transformer预测百万字节序列

机器学习 2023-05-23 v2

摘要

自回归Transformer对短序列而言是卓越的模型,但扩展到高分辨率图像、播客、代码或书籍等长序列时性能急剧下降。我们提出Megabyte,一种多尺度解码器架构,可对超过一百万字节的序列进行端到端可微建模。Megabyte将序列分段为块,并在块内使用局部子模型、在块间使用全局模型。这实现了次二次自注意力、在相同计算量下大得多的前馈层,以及解码期间更好的并行性——以更低的训练与生成代价解锁更优性能。大量实验表明,Megabyte使字节级模型在长上下文语言建模上可与子词模型竞争,在ImageNet上取得最先进的密度估计,并从原始文件建模音频。这些结果共同确立了大规模无分词自回归序列建模的可行性。

关键词

引用

@article{arxiv.2305.07185,
  title  = {MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers},
  author = {Lili Yu and Dániel Simig and Colin Flaherty and Armen Aghajanyan and Luke Zettlemoyer and Mike Lewis},
  journal= {arXiv preprint arXiv:2305.07185},
  year   = {2023}
}