VisionLLaMA:面向视觉任务的统一 LLaMA 骨干网络
计算机视觉与模式识别
2024-07-09 v2
摘要
大型语言模型建立在基于 Transformer 的架构之上以处理文本输入。例如,LLaMA 在众多开源实现中脱颖而出。同样的 Transformer 能否用于处理二维图像?在本文中,我们通过揭示一种平面形式和金字塔形式的类 LLaMA 视觉 Transformer(命名为 VisionLLaMA)来回答这个问题,该模型专为此目的而定制。VisionLLaMA 是一个用于解决大多数视觉任务的统一且通用的建模框架。我们在大量下游任务(特别是图像感知和图像生成任务)中,使用典型的预训练范式广泛评估了其有效性。在许多情况下,VisionLLaMA 表现出比先前最先进的视觉 Transformer 显著的优势。我们相信 VisionLLaMA 可以作为视觉生成和理解的一个强有力的新基线模型。我们的代码已发布在 https://github.com/Meituan-AutoML/VisionLLaMA。
引用
@article{arxiv.2403.00522,
title = {VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks},
author = {Xiangxiang Chu and Jianlin Su and Bo Zhang and Chunhua Shen},
journal= {arXiv preprint arXiv:2403.00522},
year = {2024}
}
备注
Accepted to ECCV2024