深入探究 ViT-22B
计算机视觉与模式识别
2025-08-07 v1
摘要
已有尝试创建类似大语言模型(LLM)的大型视觉模型结构,如 ViT-22B。尽管该研究提供了诸多分析和见解,但我们对其实际效用仍存疑惑。因此,我们检视该模型结构在局部环境中的反应和训练方式。我们还指出训练中的不稳定性,并对其进行了一些模型修改以实现稳定。ViT-22B 模型在相同参数规模下相较于 ViT 在性能方面表现出色。此外,我们探索了图像生成任务,这在 ViT-22B 中尚未尝试。我们提出一种基于 ViT 的图像生成架构,并探讨 ViT 与 ViT-22B 哪种结构更适合图像生成。
引用
@article{arxiv.2508.04181,
title = {Deeper Inside Deep ViT},
author = {Sungrae Hong},
journal= {arXiv preprint arXiv:2508.04181},
year = {2025}
}
备注
8 pages, 5 figures