中文

ScenarioCLIP:用于自然场景分析的预训练可迁移视觉语言模型和动作-基因数据集

计算机视觉与模式识别 2025-11-26 v1

摘要

直到最近,CLIP 类基础模型的通用语料库广泛探索要么检索短描述,要么对场景中的对象进行分类,作为单对象图像分类任务。同样的情况也适用于给定文本提示检索图像嵌入(图像检索任务)。然而,真实世界的场景图像表现出丰富的组成结构,涉及多个对象和动作。CLIP 文献中最新方法通过挖掘更难的负面图像文本对并优化永久性文本提示(常使用 LLM),提高了类别级判别力,但这些改进局限于预定义类别列表,未显式建模关系或组成结构。PyramidCLIP 部分解决了这一问题,通过对齐全局和局部视觉特征,但仍缺乏对对象间关系的显式建模。为进一步利用这一方面进行场景分析,所提出的 ScenarioCLIP 模型接受输入文本、关联关系以及输入图像,以及聚焦区域以突出显示关系。该模型在精选场景数据上进行预训练,并针对特定下游任务进行微调,如跨模态检索和细粒度视觉理解任务。为解决缺乏特定数据集的问题,我们通过扩展现有多样化室内和户外场景数据集中可获得的图像文本对,生成了新数据集。我们使用现有语言模型管道对动作、对象和关系进行 grounding,随后通过人工和自动审阅进行填充。我们建立了针对几种场景任务的综合基准,并与众多基线方法进行比较。ScenarioCLIP 在各种特定任务上表现出稳健的零样例和微调性能。我们的代码和数据集已提供。

关键词

引用

@article{arxiv.2511.20274,
  title  = {ScenarioCLIP: Pretrained Transferable Visual Language Models and Action-Genome Dataset for Natural Scene Analysis},
  author = {Advik Sinha and Saurabh Atreya and Aashutosh A and Sk Aziz Ali and Abhijit Das},
  journal= {arXiv preprint arXiv:2511.20274},
  year   = {2025}
}