中文

基于 Perceiver AR 的通用长上下文自回归建模

机器学习 2022-06-15 v2 人工智能 计算机视觉与模式识别 声音 音频与语音处理

摘要

现实世界数据是高维的:一本书、一幅图像或一场音乐演奏即使在压缩后也很容易包含数十万个元素。然而,最常用的自回归模型 Transformer 在扩展到捕捉这种长程结构所需的输入数量和层数时,成本高得令人望而却步。我们开发了 Perceiver AR,一种自回归、模态无关的架构,它使用交叉注意力将长程输入映射到少量隐变量,同时保持端到端的因果掩码。Perceiver AR 可以直接处理超过十万的 token,从而实现实用的长上下文密度估计,无需手工设计的稀疏模式或记忆机制。在图像或音乐上训练时,Perceiver AR 生成具有清晰长期一致性与结构的输出。我们的架构还在长序列基准测试上取得了最先进的似然值,包括 64 x 64 ImageNet 图像和 PG-19 书籍。

关键词

引用

@article{arxiv.2202.07765,
  title  = {General-purpose, long-context autoregressive modeling with Perceiver AR},
  author = {Curtis Hawthorne and Andrew Jaegle and Cătălina Cangea and Sebastian Borgeaud and Charlie Nash and Mateusz Malinowski and Sander Dieleman and Oriol Vinyals and Matthew Botvinick and Ian Simon and Hannah Sheahan and Neil Zeghidour and Jean-Baptiste Alayrac and João Carreira and Jesse Engel},
  journal= {arXiv preprint arXiv:2202.07765},
  year   = {2022}
}

备注

ICML 2022