一幅分裂的图像:视觉变换器中的模块化超像素分词
计算机视觉与模式识别
2025-11-18 v2 人工智能
机器学习
摘要
视觉变换器架构传统上采用与图像语义内容无关的基于网格的分词方法。我们提出了一种模块化超像素分词策略,将分词与特征提取解耦;这是从当代将两者视为不可区分整体的方法中转变而来。利用在线内容感知分词以及尺度和形状不变的位置嵌入,我们进行了实验和消融研究,将我们的方法与基于块的分词和随机划分作为基线进行对比。我们证明该方法显著提升了归因的忠实度,在零样本无监督密集预测任务上实现了像素级粒度,同时在分类任务中保持了预测性能。我们的方法提供了一个可与标准架构兼容的模块化分词框架,将视觉变换器的空间扩展到语义更丰富的更大类别模型。
引用
@article{arxiv.2408.07680,
title = {A Spitting Image: Modular Superpixel Tokenization in Vision Transformers},
author = {Marius Aasan and Odd Kolbjørnsen and Anne Schistad Solberg and Adín Ramirez Rivera},
journal= {arXiv preprint arXiv:2408.07680},
year = {2025}
}
备注
To appear in ECCV (MELEX) 2024 Workshop Proceedings