中文

更少的Token,更大的扩展:自适应的视觉基元用于高效且广泛的表征学习

计算机视觉与模式识别 2025-11-26 v1

摘要

本文研究了模型容量与保留图像语义所需的最少视觉Token数量之间的基本关系。受最小描述长度原理启发,我们将图像Token重新解释为视觉语义空间中的向量,并将图像的内在语义复杂度定义为张成该空间所需的最小基向量集。基于这一视角,我们提出正交滤波(Orthogonal Filtering),一个将冗余Token自适应地聚类为紧凑正交基组的轻量级模块。通过在多种ViT模型上的广泛实验,我们揭示了一致的Token-模型缩放定律:更大的模型需要显著更少的Token来张成视觉语义空间。此外,我们还贡献了一个视觉长上下文数据集。

关键词

引用

@article{arxiv.2511.19515,
  title  = {Fewer Tokens, Greater Scaling: Self-Adaptive Visual Bases for Efficient and Expansive Representation Learning},
  author = {Shawn Young and Xingyu Zeng and Lijian Xu},
  journal= {arXiv preprint arXiv:2511.19515},
  year   = {2025}
}