中文

Pix2Cap-COCO:通过像素级描述实现视觉理解

计算机视觉与模式识别 2025-01-24 v1 人工智能 机器学习

摘要

我们提出 Pix2Cap-COCO,这是首个设计用于推动细粒度视觉理解的全景像素级描述数据集。为实现此目标,我们仔细设计了自动标注管道,引导 GPT-4V 为图像中 individual 对象的像素对齐、实例特定描述生成,从而使模型能够学习更细致的对象与其上下文之间的关系。该方法产生 167,254 条详细描述,平均每条描述 22.94 个词。基于 Pix2Cap-COCO,我们引入一种新任务,全景分割-描述,挑战模型在图像中识别实例并为每个实例提供详细描述。为对标该任务,我们设计了基于 X-Decoder 的稳健基线。实验结果表明,Pix2Cap-COCO 是一个特别具有挑战性的数据集,要求模型在细粒度视觉理解和详细语言生成方面都表现出色。此外,我们利用 Pix2Cap-COCO 对大型多模态模型(LMM)进行监督式微调(SFT),以提升其性能。例如,使用 Pix2Cap-COCO 训练可显著提升 GPT4RoI 在 Visual Genome 数据集上的性能,CIDEr 提升 +1.4%,ROUGE 提升 +0.4%,SPICE 提升 +0.5%,并在 ViP-BENCH 上增强其区域理解能力,整体提升 +5.1%,包括识别准确率 +11.2% 和语言生成质量 +22.2% 的显著提升。

关键词

引用

@article{arxiv.2501.13893,
  title  = {Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning},
  author = {Zuyao You and Junke Wang and Lingyu Kong and Bo He and Zuxuan Wu},
  journal= {arXiv preprint arXiv:2501.13893},
  year   = {2025}
}