中文

卷积集合 Transformer

计算机视觉与模式识别 2025-09-30 v1 人工智能 机器学习

摘要

我们引入了卷积集合 Transformer(Convolutional Set Transformer, CST),这是一种新颖的神经架构,旨在处理任意基数的图像集,这些图像在视觉上异构但共享高级语义——例如共同的类别、场景或概念。现有的集合输入网络,例如 Deep Sets 和 Set Transformer,仅限于向量输入,不能直接处理 3D 图像张量。因此,它们必须与特征提取器(通常是 CNN)级联,后者将图像编码为嵌入,然后集合输入网络才能建模图像间的关系。相比之下,CST 直接对 3D 图像张量进行操作,同时执行特征提取和上下文建模,从而实现了两个过程之间的协同作用。这种设计在集合分类和集合异常检测等任务中产生了优越的性能,并进一步提供了与 CNN 可解释性方法(如 Grad-CAM)的原生兼容性,这与保持不透明的竞争方法不同。最后,我们展示了 CST 可以在大规模数据集上进行预训练,并随后通过标准的迁移学习方案适应新的领域和任务。为了支持进一步的研究,我们发布了 CST-15,一个在 ImageNet 上预训练的 CST 骨干网络(https://github.com/chinefed/convolutional-set-transformer)。

关键词

引用

@article{arxiv.2509.22889,
  title  = {Convolutional Set Transformer},
  author = {Federico Chinello and Giacomo Boracchi},
  journal= {arXiv preprint arXiv:2509.22889},
  year   = {2025}
}