单遍自适应图像分词:用于最小程序搜索
计算机视觉与模式识别
2025-07-11 v1 人工智能
机器学习
摘要
根据算法信息论(Algorithmic Information Theory, AIT)的理论,智能表征应将数据压缩为能够重构其内容的最短程序,从而表现出低的柯克莫尔复杂度(Kolmogorov Complexity, KC)。然而,大多数视觉表征学习系统为所有输入使用固定长度的表征,忽略了复杂度或熟悉程度的差异。近期的自适应分词方法通过分配可变长度的表征来解决这一问题,但通常需要在多个编码之间进行测试时搜索,以找到最具预测性的编码。受柯克莫尔复杂度原理启发,我们提出一种单遍自适应分词器KARL,它在单次前向传播中预测图像的合适标记数,一旦达到近似KC即停止。标记计数可作为最小描述长度的代理指标。KARL的训练过程类似于倒置强化学习范式,因其学习基于所需重构质量的条件性预测标记停止。KARL在单次前向传播中匹配最新自适应分词器的性能。我们present了KARL的尺度律,分析了编码器/解码器大小、连续与离散分词等因素的作用。此外,我们提供了一项概念性研究,将自适应图像分词与算法信息论进行类比,探讨了预测图像复杂度(KC)在结构 vs. 噪声、内部 vs. 外部分布熟悉度等维度上的表现——这些结果与人类直觉相吻合。
引用
@article{arxiv.2507.07995,
title = {Single-pass Adaptive Image Tokenization for Minimum Program Search},
author = {Shivam Duggal and Sanghyun Byun and William T. Freeman and Antonio Torralba and Phillip Isola},
journal= {arXiv preprint arXiv:2507.07995},
year = {2025}
}
备注
Code at: https://github.com/ShivamDuggal4/karl Keywords: Representation Learning, Adaptive Tokenization, Compression, Algorithmic Information Theory, Kolmogorov Complexity, Upside-Down RL