中文

图像是否也值得 16x16=256 超级像素?基于注意力的图像分类框架

计算机视觉与模式识别 2026-05-27 v1 机器学习

摘要

超级像素图像分类传统上依赖图神经网络(GNN)处理不规则的图像表示。近期计算机视觉进步由 Vision Transformer(ViT)驱动,引入了自注意力模型的新范式,超越卷积神经网络(CNN)在诸多任务中取得优异成绩。然而,GNN、超级像素与 Transformer 之间存在协同连接仍未被探索。本文提出 Superpixel Transformers(SPT),一种新型框架,统一了超级像素图像分类与 ViT。SPT 泛化了基于图注意力网络的超级像素图像分类(SICGAT)模型和 ViT,以支持任意超级像素分块策略、连接图和位置编码。我们引入了改进,包括多维 sine-cosine 位置编码和充分包含超级像素形状和颜色信息的丰富 patch 数据结构。通过在 CIFAR10、FashionMNIST 和 Imagenette 等数据集上进行测试,并采用各种超级像素生成和图连接策略,我们展示了 SPT 在各种任务上的优异性能,优于以往基于超级像素的 GNN 方法,同时与 ViT 保持竞争力。值得注意的是,我们的方法解决了 SICGAT 在像素聚合过程中信息损失的局限性,并展示了受限图连接如何提升 ViT 性能。SPT 弥合了超级像素模型与 Transformer 模型之间的鸿沟,为跨域泛化和未来混合注意力框架的创新开辟了道路,表明图像也值得 16x16 个超级像素。

关键词

引用

@article{arxiv.2605.27144,
  title  = {Is an Image Also Worth 16x16=256 Superpixels? A Framework for Attentional Image Classification},
  author = {Pedro Henrique da Costa Avelar and Anderson R. Tavares and Luís C. Lamb},
  journal= {arXiv preprint arXiv:2605.27144},
  year   = {2026}
}