中文

VLCounter:面向零样本目标计数的文本感知视觉表示

计算机视觉与模式识别 2024-01-02 v2

摘要

零样本目标计数(ZSOC)旨在无需人工标注的示例,对查询图像中任意类别的实例进行计数。为了处理ZSOC,先前的研究提出了两阶段流程:发现示例和计数。然而,顺序设计的两阶段过程存在对错误传播的脆弱性挑战。在这项工作中,提出了一个单阶段基线——视觉-语言基线(VLBase),探索CLIP的语义-补丁嵌入的隐式关联。随后,通过引入三个为计数任务定制VLBase的模块,实现了VLBase向视觉-语言计数器(VLCounter)的扩展。首先,在图像编码器中引入语义条件提示调优(SPT)以获得目标高亮表示。其次,采用可学习仿射变换(LAT)将语义-补丁相似度图转换为适合计数任务的形式。最后,通过分割感知跳跃连接(SaSC)将逐层编码的特征传递到解码器,以保持对未见类别的泛化能力。通过在FSC147、CARPK和PUCPR+上的大量实验,展示了端到端框架VLCounter的优势。

关键词

引用

@article{arxiv.2312.16580,
  title  = {VLCounter: Text-aware Visual Representation for Zero-Shot Object Counting},
  author = {Seunggu Kang and WonJun Moon and Euiyeon Kim and Jae-Pil Heo},
  journal= {arXiv preprint arXiv:2312.16580},
  year   = {2024}
}

备注

Accepted to AAAI 2024. Code is available at https://github.com/Seunggu0305/VLCounter