中文

ClustViT:面向语义分割的基于聚类的 Token 合并

计算机视觉与模式识别 2026-05-04 v2

摘要

Vision Transformer 能够在各种上下文中实现高精度和强泛化能力,但由于其二次方注意力复杂度,其在现实世界机器人系统中的实际适用性受到限制。近期的工作主要集中在根据图像复杂度动态合并 Token。Token 合并在分类任务中表现良好,但不太适合密集预测。我们提出了 ClustViT,在 Vision Transformer (ViT) 主干的基础上进行扩展,以解决语义分割问题。在我们的架构中,一个可训练的 Cluster 模块在来自分割掩码的伪聚类的指导下,沿网络合并相似的 Token。随后,Regenerator 模块为下游头部恢复精细细节。我们的方法在三个不同的数据集上实现了高达 2.18 倍的 GFLOPs 减少和 1.64 倍的推理加速,且分割精度相当。我们的代码和模型将公开发布。

关键词

引用

@article{arxiv.2510.01948,
  title  = {ClustViT: Clustering-based Token Merging for Semantic Segmentation},
  author = {Fabio Montello and Ronja Güldenring and Lazaros Nalpantidis},
  journal= {arXiv preprint arXiv:2510.01948},
  year   = {2026}
}

备注

Submitted to IEEE