中文

分析视觉 Token 的语言

计算机视觉与模式识别 2024-11-08 v1 人工智能 计算与语言 机器学习

摘要

随着基于 Transformer 的视觉和语言模型(如 LLaVA 和 Chameleon)的引入,人们对图像的离散 token 化表示重新产生了兴趣。这些模型通常将图像块视为离散 token,类似于自然语言中的单词,学习视觉语言与人类语言之间的联合对齐。然而,人们对这些视觉语言的统计行为知之甚少——它们是否遵循与自然语言相似的频率分布、语法结构或拓扑结构。在本文中,我们采用以自然语言为中心的方法分析离散视觉语言,并发现了显著的相似性和根本差异。我们证明,尽管视觉语言遵循 Zipf 分布,但更高的 token 创新驱动更大的熵和更低的压缩率,token 主要表示物体部分,表明中间粒度。我们还表明,视觉语言缺乏 cohesive 的语法结构,导致与自然语言相比更高的困惑度和更弱的层次组织。最后,我们证明,尽管视觉模型比其他模型更接近自然语言,但这种对齐仍然显著弱于自然语言内部的凝聚力。通过这些实验,我们展示了理解离散视觉语言的统计属性如何指导更有效的计算机视觉模型的设计。

关键词

引用

@article{arxiv.2411.05001,
  title  = {Analyzing The Language of Visual Tokens},
  author = {David M. Chan and Rodolfo Corona and Joonyong Park and Cheol Jun Cho and Yutong Bai and Trevor Darrell},
  journal= {arXiv preprint arXiv:2411.05001},
  year   = {2024}
}