CREPE:基于 CLIP 的可学习提示提升视觉关系预测
计算机视觉与模式识别
2023-07-20 v2 机器学习
摘要
本文中,我们探索了视觉-语言模型(VLMs),特别是 CLIP,在预测视觉物体关系中的潜力,该任务涉及将图像中的视觉特征解释为基于语言的关系。当前最先进的方法使用复杂的图模型,利用语言线索和视觉特征来应对这一挑战。我们假设 CLIP 嵌入中强大的语言先验可以简化这些图模型,从而为更简洁的方法铺平道路。我们采用了 UVTransE 关系预测框架,该框架将关系学习为场景中主体、客体和联合框嵌入的平移嵌入。我们系统地探索了在 UVTransE 框架内基于 CLIP 的主体、客体和联合框表示的设计,并提出了 CREPE(CLIP 表示增强的谓词估计)。CREPE 对所有三个边界框利用基于文本的表示,并引入一种新颖的对比训练策略来自动推断联合框的文本提示。我们的方法在 Visual Genome 基准上以谓词估计 mR@5 27.79 和 mR@20 31.95 取得了最先进性能,在 mR@20 上比近期最先进方法提升 15.3%。本工作展示了 CLIP 在物体关系预测中的有效性,并鼓励在该具挑战性领域中进一步研究 VLMs。
引用
@article{arxiv.2307.04838,
title = {CREPE: Learnable Prompting With CLIP Improves Visual Relationship Prediction},
author = {Rakshith Subramanyam and T. S. Jayram and Rushil Anirudh and Jayaraman J. Thiagarajan},
journal= {arXiv preprint arXiv:2307.04838},
year = {2023}
}