具有三维旋转位置嵌入的交叉轴 Transformer
计算机视觉与模式识别
2024-12-18 v3 人工智能
摘要
尽管在许多方面落后于其模态近亲,视觉 Transformer 已提供了弥合序列建模与图像建模间差距的有趣机会。然而迄今为止,视觉 Transformer 大体上受限于计算低效以及对空间维度缺乏恰当处理。本文中,我们引入交叉轴 Transformer(CAT)。CAT 是受轴向 Transformer 与微软近期保留网络(Retentive Network)启发的模型,其大幅减少了处理图像所需的浮点运算次数,同时比其所替代的视觉 Transformer 收敛更快且更准。
引用
@article{arxiv.2311.07184,
title = {Cross-Axis Transformer with 3D Rotary Positional Embeddings},
author = {Lily Erickson},
journal= {arXiv preprint arXiv:2311.07184},
year = {2024}
}
备注
7 pages, 8 figures