中文

开箱即用的视觉 Transformer:少样本类无关计数的一个令人惊讶的基线

计算机视觉与模式识别 2024-03-05 v2

摘要

类无关计数 (CAC) 旨在给定少量示例的情况下,从查询图像中统计感兴趣物体的数量。该任务通常通过分别提取查询图像与示例的特征,然后匹配其特征相似度来解决,从而形成先提取后匹配的范式。在本工作中,我们表明 CAC 可以以提取并匹配的方式简化,特别是使用视觉 Transformer (ViT),其中特征提取与相似度匹配在自注意力中同时执行。我们从自注意力解耦的视角揭示了这种简化的原理。由此产生的模型称为 CACViT,将 CAC 流程简化为单个预训练的普通 ViT。此外,为补偿普通 ViT 中因缩放与归一化而损失的尺度与数量级信息,我们提出了尺度与幅值嵌入两种有效策略。在 FSC147 与 CARPK 数据集上的大量实验表明,CACViT 在有效性(误差降低 23.60%)与泛化性上均显著优于最先进的 CAC 方法,这表明 CACViT 为 CAC 提供了一个简洁而强大的基线。代码将公开。

关键词

引用

@article{arxiv.2305.04440,
  title  = {Vision Transformer Off-the-Shelf: A Surprising Baseline for Few-Shot Class-Agnostic Counting},
  author = {Zhicheng Wang and Liwen Xiao and Zhiguo Cao and Hao Lu},
  journal= {arXiv preprint arXiv:2305.04440},
  year   = {2024}
}