中文

ClipSitu:在情境识别中有效利用CLIP进行条件预测

计算机视觉与模式识别 2023-09-12 v3

摘要

情境识别(Situation Recognition)的任务是利用活动动词以及参与者和对象所扮演的语义角色,生成图像中正在发生事件的结构化摘要。在该任务中,同一活动动词可描述多种不同的情境,且同一参与者或对象类别可根据图像所描绘的情境扮演多种不同的语义角色。因此,情境识别模型需要理解图像的上下文以及语义角色的视觉-语言含义。为此,我们利用CLIP基础模型,其已通过语言描述学习了图像的上下文。我们表明,通过使用CLIP图像与文本嵌入特征,更深更宽的多层感知机(MLP)模块在情境识别任务上取得了显著结果,并且甚至优于基于Transformer的最先进模型CoFormer,这得益于CLIP所封装的外部隐式视觉-语言知识以及现代MLP模块设计的表达能力。受此启发,我们设计了一种基于交叉注意力的Transformer,使用CLIP视觉令牌来建模文本角色与视觉实体之间的关系。我们这种基于交叉注意力的Transformer称为ClipSitu XTF,在imSitu数据集上以14.1%的大幅度优势超越现有最先进方法,在语义角色标注(值)的top-1准确率上取得领先。{类似地,我们的ClipSitu XTF获得了最先进的情境定位性能。}我们将公开代码。

关键词

引用

@article{arxiv.2307.00586,
  title  = {ClipSitu: Effectively Leveraging CLIP for Conditional Predictions in Situation Recognition},
  author = {Debaditya Roy and Dhruv Verma and Basura Fernando},
  journal= {arXiv preprint arXiv:2307.00586},
  year   = {2023}
}

备注

State-of-the-art results on Grounded Situation Recognition