中文

将 LLaMA 解码器适配至 Vision Transformer

计算机视觉与模式识别 2024-05-28 v4

摘要

本工作探讨了最初为大语言模型(LLMs)设计的纯解码器 Transformer(如 LLaMA)能否适配至计算机视觉领域。我们首先逐步对标准 ViT 进行“LLaMA化”以与 LLaMA 的架构对齐,并发现直接将因果掩码应用于自注意力会带来注意力崩溃问题,导致网络训练失败。我们建议采用后序列类 token 技术将类 token 重新定位至图像 token 之后以克服这一挑战,使得因果自注意力能够高效捕获整个图像的信息。此外,我们开发了一种软掩码策略,在训练开始时逐步向自注意力引入因果掩码以促进优化行为。这种定制的模型被称为 image LLaMA(iLLaMA),其架构类似于 LLaMA 并支持直接监督学习。其因果自注意力提升了计算效率,并通过提升注意力图秩来学习复杂表示。iLLaMA 的性能可与其纯编码器对应模型相媲美,在仅 5.7M 参数下实现了 75.1% 的 ImageNet top-1 准确率。将模型扩展至 \sim310M 并在 ImageNet-21K 上预训练,进一步将准确率提升至 86.0%。大量实验证明了 iLLaMA 的可靠特性:形状-纹理偏置、校准、量化兼容性、ADE20K 分割和 CIFAR 迁移学习。我们希望我们的研究能在 LLMs 的浪潮中为视觉架构激发新的视角,并启发统一多模态模型的发展。预训练模型和代码可在 https://github.com/techmonsterwang/iLLaMA 获取。

关键词

引用

@article{arxiv.2404.06773,
  title  = {Adapting LLaMA Decoder to Vision Transformer},
  author = {Jiahao Wang and Wenqi Shao and Mengzhao Chen and Chengyue Wu and Yong Liu and Taiqiang Wu and Kaipeng Zhang and Songyang Zhang and Kai Chen and Ping Luo},
  journal= {arXiv preprint arXiv:2404.06773},
  year   = {2024}
}

备注

23 pages, 11 figures