OmniNet:来自 Transformer 的全向表示
计算机视觉与模式识别
2021-03-02 v1 人工智能
计算与语言
机器学习
摘要
本文提出 OmniNet(OmniNet:来自 Transformer 的全向表示)。在 OmniNet 中,每个 token 不被限制于严格的水平感受野,而是允许关注整个网络中的所有 token。该过程也可被解释为一种极端或密集注意力机制,其具有整个网络宽度与深度的感受野。为此,全向注意力通过一个元学习器来学习,该元学习器本质上是一个基于自注意力的另一模型。为缓解全感受野注意力的计算高昂代价,我们利用高效的自注意力模型,如基于核的(Choromanski 等人)、低秩注意力(Wang 等人)和/或 Big Bird(Zaheer 等人)作为元学习器。我们在自回归语言建模(LM1B、C4)、机器翻译、Long Range Arena(LRA)和图像识别上进行了大量实验。实验表明 OmniNet 在这些任务上取得了可观的提升,包括在 LM1B、WMT'14 En-De/En-Fr 和 Long Range Arena 上达到最先进性能。此外,在 Vision Transformers 中使用全向表示在少样本学习与微调设定下的图像识别任务中均带来显著改进。
引用
@article{arxiv.2103.01075,
title = {OmniNet: Omnidirectional Representations from Transformers},
author = {Yi Tay and Mostafa Dehghani and Vamsi Aribandi and Jai Gupta and Philip Pham and Zhen Qin and Dara Bahri and Da-Cheng Juan and Donald Metzler},
journal= {arXiv preprint arXiv:2103.01075},
year = {2021}
}