中文

图像即点集

计算机视觉与模式识别 2023-03-03 v1

摘要

什么是图像,如何提取潜在特征?卷积网络(ConvNets)将图像视为矩形排列的有组织像素,并通过局部区域的卷积操作提取特征;视觉Transformer(ViTs)将图像视为图像块序列,并通过全局范围的注意力机制提取特征。在这项工作中,我们提出了一种直接且有前景的视觉表示范式,称为上下文聚类(Context Clusters)。上下文聚类(CoCs)将图像视为一组无组织的点,并通过简化的聚类算法提取特征。具体而言,每个点包含原始特征(如颜色)和位置信息(如坐标),并采用简化的聚类算法分层地分组并提取深层特征。我们的CoCs不依赖卷积和注意力,仅依靠聚类算法进行空间交互。得益于简洁的设计,我们通过聚类过程的可视化展示了CoCs令人满意的可解释性。我们的CoCs旨在为图像与视觉表示提供新视角,这可能在多个领域拥有广泛应用并展现深刻洞见。尽管我们不追求SOTA性能,CoCs在多个基准上仍取得了与ConvNets或ViTs相当甚至更优的结果。代码见:https://github.com/ma-xu/Context-Cluster。

关键词

引用

@article{arxiv.2303.01494,
  title  = {Image as Set of Points},
  author = {Xu Ma and Yuqian Zhou and Huan Wang and Can Qin and Bin Sun and Chang Liu and Yun Fu},
  journal= {arXiv preprint arXiv:2303.01494},
  year   = {2023}
}

备注

ICLR'23 Oral (top 5%); Codes: https://github.com/ma-xu/Context-Cluster