中文

标记空间中的扩张能力:大型视觉语言模型分析

人工智能 2025-12-30 v4 机器学习

摘要

大型语言模型已显示出关于模型参数和训练数据的可预测扩张行为。本研究探讨了视觉语言模型关于视觉标记数量是否存在类似的扩张关系。发展了一种数学框架,用于刻画视觉标记数量与视觉参考序列之间预期距离偏差之间的关系。理论分析揭示了两种不同的扩张 regime:对于较少的视觉标记呈亚线性扩张,而对于较多的视觉标记呈线性扩张。这与模型性能关系形式 S(n)c/nα(n)S(n) \approx c / n^{\alpha(n)} 一致,其中扩张指数与视觉标记表示之间的相关结构有关。跨多个视觉语言基准的经验验证表明,模型性能匹配来自扩张关系的预测。这些发现通过一种补充经验观察的理论框架,促进了对 transformer 中视觉标记扩张的理解。

关键词

引用

@article{arxiv.2412.18387,
  title  = {Scaling Capability in Token Space: An Analysis of Large Vision Language Model},
  author = {Tenghui Li and Guoxu Zhou and Xuyang Zhao and Qibin Zhao},
  journal= {arXiv preprint arXiv:2412.18387},
  year   = {2025}
}