更少的Token,更大的扩展:自适应的视觉基元用于高效且广泛的表征学习
计算机视觉与模式识别
2025-11-26 v1
摘要
本文研究了模型容量与保留图像语义所需的最少视觉Token数量之间的基本关系。受最小描述长度原理启发,我们将图像Token重新解释为视觉语义空间中的向量,并将图像的内在语义复杂度定义为张成该空间所需的最小基向量集。基于这一视角,我们提出正交滤波(Orthogonal Filtering),一个将冗余Token自适应地聚类为紧凑正交基组的轻量级模块。通过在多种ViT模型上的广泛实验,我们揭示了一致的Token-模型缩放定律:更大的模型需要显著更少的Token来张成视觉语义空间。此外,我们还贡献了一个视觉长上下文数据集。
引用
@article{arxiv.2511.19515,
title = {Fewer Tokens, Greater Scaling: Self-Adaptive Visual Bases for Efficient and Expansive Representation Learning},
author = {Shawn Young and Xingyu Zeng and Lijian Xu},
journal= {arXiv preprint arXiv:2511.19515},
year = {2025}
}