视觉 token 能承载多少信息?视觉模型识别极限的尺度律
机器学习
2026-02-04 v1 计算机视觉与模式识别
摘要
近期的视觉中心方法在长上下文建模方面取得了显著进展。以 DeepSeek-OCR 为代表的模型将渲染文本编码为连续视觉 token,实现高压缩率而不牺牲识别精度。然而,將视觉编码器视为具有有限表示容量的有损信道,引发 fundamental 的问题:视觉 token 的信息上限为何?为调查此限制,我们通过 progressively 增加图像中信息量(字符数)进行受控压力测试。我们观察到一种 distinct 的相位转变现象,包含近乳完美的稳定相、以错误方差增加为特征的不稳定相,以及完全坍塌相三个阶段。我们分析了这些转变的机械起源并识别出关键因素。此外,我们构建了一种概率性尺度律,将平均视觉 token 负载和视觉密度统一为隐含难度指标。广泛的实验表明,这种尺度律在各种视觉语言模型间具有普适性,为在视觉上下文压缩中在效率与精度之间进行权衡提供了关键实证指导。
引用
@article{arxiv.2602.02539,
title = {How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs},
author = {Shuxin Zhuang and Zi Liang and Runsheng Yu and Hongzong Li and Rong Feng and Shiqin Tang and Youzhi Zhang},
journal= {arXiv preprint arXiv:2602.02539},
year = {2026}
}