用于自适应视觉标记化的软尾丢弃法
计算机视觉与模式识别
2026-01-21 v1
摘要
我们提出了软尾丢弃自适应分词器(STAT),一个一维离散视觉分词器,它根据图像的结构复杂性和细节水平自适应地选择每张图像的输出标记数量。STAT将图像编码为一系列离散编码以及每个标记的保留概率。除了标准的自编码器目标外,我们正则化这些保留概率,使其沿序列单调递减,并明确地将其分布与图像级复杂性度量对齐。因此,STAT生成长度自适应的一维视觉标记,这些标记自然地与因果一维自回归(AR)视觉生成模型兼容。在ImageNet-1k上,将普通的因果AR模型与STAT结合,与其他概率模型族相比,产生了具有竞争力或更优的视觉生成质量,同时还表现出有利的缩放行为,这在先前的普通AR视觉生成尝试中难以实现。
引用
@article{arxiv.2601.14246,
title = {Soft Tail-dropping for Adaptive Visual Tokenization},
author = {Zeyuan Chen and Kai Zhang and Zhuowen Tu and Yuanjun Xiong},
journal= {arXiv preprint arXiv:2601.14246},
year = {2026}
}