中文

面向视觉的白盒 Transformer 规模化

计算机视觉与模式识别 2025-01-15 v4

摘要

CRATE 是一种为学习压缩稀疏表示而设计的白盒变换器架构,因其内在的数学可解释性而为标准视觉变换器 (ViT) 提供了引人入胜的替代方案。尽管对语言和视觉变换器的规模行为进行了广泛调查,但 CRATE 的规模化仍是一个开放问题,本文旨在解决。具体而言,我们提出 CRATE-α\alpha,该方案在 CRATE 架构设计中对稀疏编码块进行战略且最小的修改,并提供一种轻训练配方以提高 CRATE 的规模化。通过大量实验,我们证明 CRATE-α\alpha 能够有效地随更大模型规模和数据集规模而扩展。例如,我们的 CRATE-α\alpha-B 在 ImageNet 分类上的准确率比 prior 最佳的 CRATE-B 模型提高了 3.7%,达到 83.2%。当进一步扩大规模时,我们的 CRATE-α\alpha-L 在 ImageNet 分类上的准确率达到 85.1%。更值得注意的是,这些模型性能的提升是在保持甚至可能增强所学习 CRATE 模型可解释性的同时实现的,我们通过展示越来越大的训练的 CRATE-α\alpha 模型所学习的标记表示产生越来越高质量的图像无监督目标分割来证明这一点。项目页面为 https://rayjryang.github.io/CRATE-alpha/。

关键词

引用

@article{arxiv.2405.20299,
  title  = {Scaling White-Box Transformers for Vision},
  author = {Jinrui Yang and Xianhang Li and Druv Pai and Yuyin Zhou and Yi Ma and Yaodong Yu and Cihang Xie},
  journal= {arXiv preprint arXiv:2405.20299},
  year   = {2025}
}

备注

project page: https://rayjryang.github.io/CRATE-alpha/