Cached Transformer:利用可微记忆缓存改进 Transformer
计算机视觉与模式识别
2023-12-21 v1
摘要
本工作引入了一种名为 Cached Transformer 的新型 Transformer 模型,该模型使用门控循环缓存 (GRC) 注意力机制,通过 token 的可微记忆缓存来扩展自注意力机制。GRC 注意力能够同时关注过去和当前的 token,增大了注意力的感受野,并允许探索长程依赖关系。通过利用循环门控单元持续更新缓存,我们的模型在包括语言建模、机器翻译、ListOPs、图像分类、目标检测和实例分割在内的六个语言和视觉任务中取得了显著进展。此外,我们的方法在语言建模等任务中超越了以往基于记忆的技术,并展现出适用于更广泛场景的能力。
引用
@article{arxiv.2312.12742,
title = {Cached Transformers: Improving Transformers with Differentiable Memory Cache},
author = {Zhaoyang Zhang and Wenqi Shao and Yixiao Ge and Xiaogang Wang and Jinwei Gu and Ping Luo},
journal= {arXiv preprint arXiv:2312.12742},
year = {2023}
}
备注
AAAI 2024