像素之上结构:学习可变长度视觉程序
计算机视觉与模式识别
2026-05-29 v2 机器学习
摘要
离散视觉标记化器将图像翻译为有序的代码序列,为场景的结构描述提供了自然的表示方式。然而,现有的自适应标记化器要么需要后验搜索,要么在离散预训练速率集合中进行选择,而不是学习与模型和场景耦合的连续每图像序列长度;而且它们通常针对像素重建进行训练,强调纹理而非结构。我们提出了STROP(结构程序),一种离散视觉标记化器架构,其形成场景结构表示,同时学习图像视觉程序应具有的长度。通过四阶段课程监督,使用针对冻结DINOv3特征的局部率失真探针,STROP优化专用的长度头部,在单次前向传播中估计活动前缀长度。通过绕过像素级重建梯度,码本完全由更高层次潜在表示的质量塑造。程序长度随场景复杂度增长,在下游密集预测迁移和直接检查所学习的代码词汇中都出现了构成性结构的迹象。
引用
@article{arxiv.2605.27696,
title = {Structure over Pixels: Learning Variable-Length Visual Programs},
author = {Piotr Wyrwiński and Kacper Dobek and Krzysztof Krawiec},
journal= {arXiv preprint arXiv:2605.27696},
year = {2026}
}