中文

SuperCap:基于多分辨率超像素的图像描述生成

计算机视觉与模式识别 2025-03-12 v1

摘要

突破对目标检测的依赖一直是图像描述生成领域的长期目标。我们研究了将超像素与视觉语言模型(VLMs)相结合的方法,以弥合基于检测器的描述生成架构与仅在大规模数据集上预训练的架构之间的差距。我们的新颖超像素方法确保模型接收类目标特征,而 VLMs 的使用为模型提供了开放集目标理解。此外,我们将架构扩展为利用多分辨率输入,使模型能够从不同细节层次查看图像,并使用注意力机制确定哪些部分对描述最为相关。我们通过多种 VLMs 展示了模型性能,并通过一系列消融实验详细说明了不同架构选择的影响。我们的完整模型在 COCO Karpathy 划分上取得了具有竞争力的 CIDEr 分数 136.9136.9

关键词

引用

@article{arxiv.2503.08496,
  title  = {SuperCap: Multi-resolution Superpixel-based Image Captioning},
  author = {Henry Senior and Luca Rossi and Gregory Slabaugh and Shanxin Yuan},
  journal= {arXiv preprint arXiv:2503.08496},
  year   = {2025}
}

备注

12 pages, 4 figures