中文

FIT:远交错的 Transformer 架构

机器学习 2023-05-26 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

我们提出 FIT:一种基于 Transformer 且具有高效自注意力与自适应计算的架构。与在单一数据词元序列上运行的原始 Transformer 不同,我们将数据词元划分为若干组,每组为一个较短的词元序列。我们采用两类 Transformer 层:局部层在每组内对数据词元进行操作,而全局层在一组较小的引入潜在词元上操作。这些层由与标准 Transformer 相同的自注意力与前馈层集合构成,彼此交错,并利用交叉注意力在同一组内促进数据与潜在词元间的信息交换。注意力复杂度在每组大小为 nn 的组内局部为 O(n2)O(n^2),但在序列长度为 LL 时全局可达 O(L4/3)O(L^{{4}/{3}})。通过更多依赖使用较小潜在词元集进行自适应计算的全局层,可进一步提升效率。FIT 是一种通用架构,可作为编码器、扩散解码器或自回归解码器。我们提供了初步证据,表明其在高分辨率图像理解与生成任务中的有效性。值得注意的是,FIT 展现出在 16GB 内存容量内对吉比特级数据(如 6400×\times6400 图像,或经块词元化后的 160K 词元)进行端到端训练的潜力,且无需特定优化或模型并行。

关键词

引用

@article{arxiv.2305.12689,
  title  = {FIT: Far-reaching Interleaved Transformers},
  author = {Ting Chen and Lala Li},
  journal= {arXiv preprint arXiv:2305.12689},
  year   = {2023}
}

备注

preliminary work (code at https://github.com/google-research/pix2seq)