可微分的层次视觉标记化
计算机视觉与模式识别
2025-11-05 v1
摘要
Vision Transformer 依赖固定的 patch token,忽略图像的空间和语义结构。本文引入一种端到端可微分的 tokenizer,能够在像素级别适应图像内容,同时保持与现有架构向后兼容,以便对预训练模型进行改造。我们的方法使用信息准则提供层次模型选择,在图像级分类和密集预测任务中均能提供具竞争力的性能,甚至支持即插即用的数据栅格到矢量转换。
引用
@article{arxiv.2511.02652,
title = {Differentiable Hierarchical Visual Tokenization},
author = {Marius Aasan and Martine Hjelkrem-Tan and Nico Catalano and Changkyu Choi and Adín Ramírez Rivera},
journal= {arXiv preprint arXiv:2511.02652},
year = {2025}
}
备注
NeurIPS 2025 Spotlight