中文

感知分组分词器:以迭代分组构建感知

计算机视觉与模式识别 2024-01-26 v2 人工智能

摘要

人类视觉识别系统展现出惊人的能力,能在无标签监督下将视觉信息压缩为一组包含丰富表示的token。其背后一个关键的驱动原则是感知分组。尽管感知分组在2010年代初被广泛用于计算机视觉,但能否借助它推导出一个生成同样强大表示的神经视觉识别骨干网络仍属未知。本文提出感知分组分词器(Perceptual Group Tokenizer),一种完全依赖分组操作来提取视觉特征并进行自监督表示学习的模型,其中使用一系列分组操作迭代地为像素或超像素假设上下文以精炼特征表示。我们表明,所提模型相比最先进的视觉架构具有竞争力,并继承了合意的性质,包括无需重训练的自适应计算与可解释性。具体而言,感知分组分词器在ImageNet-1K自监督学习基准的线性探测评估上达到80.3%,标志着该范式下的新进展。

关键词

引用

@article{arxiv.2311.18296,
  title  = {Perceptual Group Tokenizer: Building Perception with Iterative Grouping},
  author = {Zhiwei Deng and Ting Chen and Yang Li},
  journal= {arXiv preprint arXiv:2311.18296},
  year   = {2024}
}

备注

The International Conference on Learning Representations (ICLR) 2024