中文

深入探究 ViT-22B

计算机视觉与模式识别 2025-08-07 v1

摘要

已有尝试创建类似大语言模型(LLM)的大型视觉模型结构,如 ViT-22B。尽管该研究提供了诸多分析和见解,但我们对其实际效用仍存疑惑。因此,我们检视该模型结构在局部环境中的反应和训练方式。我们还指出训练中的不稳定性,并对其进行了一些模型修改以实现稳定。ViT-22B 模型在相同参数规模下相较于 ViT 在性能方面表现出色。此外,我们探索了图像生成任务,这在 ViT-22B 中尚未尝试。我们提出一种基于 ViT 的图像生成架构,并探讨 ViT 与 ViT-22B 哪种结构更适合图像生成。

关键词

引用

@article{arxiv.2508.04181,
  title  = {Deeper Inside Deep ViT},
  author = {Sungrae Hong},
  journal= {arXiv preprint arXiv:2508.04181},
  year   = {2025}
}

备注

8 pages, 5 figures