中文

可微分的层次视觉标记化

计算机视觉与模式识别 2025-11-05 v1

摘要

Vision Transformer 依赖固定的 patch token,忽略图像的空间和语义结构。本文引入一种端到端可微分的 tokenizer,能够在像素级别适应图像内容,同时保持与现有架构向后兼容,以便对预训练模型进行改造。我们的方法使用信息准则提供层次模型选择,在图像级分类和密集预测任务中均能提供具竞争力的性能,甚至支持即插即用的数据栅格到矢量转换。

关键词

引用

@article{arxiv.2511.02652,
  title  = {Differentiable Hierarchical Visual Tokenization},
  author = {Marius Aasan and Martine Hjelkrem-Tan and Nico Catalano and Changkyu Choi and Adín Ramírez Rivera},
  journal= {arXiv preprint arXiv:2511.02652},
  year   = {2025}
}

备注

NeurIPS 2025 Spotlight