基于大语言模型复合视觉线索的零样本视觉关系检测
计算机视觉与模式识别
2023-11-29 v4
摘要
预训练的视觉-语言模型(如 CLIP)已展现出强大的泛化能力,使其成为零样本视觉识别领域中有前景的工具。视觉关系检测(VRD)是一项典型任务,旨在识别图像中物体对之间的关系(或交互)类型。然而,朴素地将 CLIP 与流行的基于类别的提示用于零样本 VRD 存在若干弱点,例如难以区分不同的细粒度关系类型,且忽略了两个物体的关键空间信息。为此,我们提出一种用于零样本 VRD 的新方法:RECODE,即通过复合描述提示解决关系检测(RElation detection via COmposite DEscription prompts)。具体而言,RECODE 首先将每个谓词类别分解为主语、宾语与空间分量。随后,它利用大语言模型(LLMs)为每个分量生成基于描述的提示(或视觉线索)。不同的视觉线索从不同角度增强了相似关系类别的可判别性,从而显著提升 VRD 性能。为动态融合不同线索,我们进一步引入一种思维链方法,提示 LLMs 为不同视觉线索生成合理权重。在四个 VRD 基准上的大量实验证明了 RECODE 的有效性与可解释性。
引用
@article{arxiv.2305.12476,
title = {Zero-shot Visual Relation Detection via Composite Visual Cues from Large Language Models},
author = {Lin Li and Jun Xiao and Guikun Chen and Jian Shao and Yueting Zhuang and Long Chen},
journal= {arXiv preprint arXiv:2305.12476},
year = {2023}
}