面向开放世界细粒度场景图生成的视觉提示语言模型
计算机视觉与模式识别
2023-08-22 v2
摘要
场景图生成(SGG)旨在从图像中提取<主体, 谓词, 客体>关系以用于视觉理解。尽管近期工作在SGG上取得了稳步进展,但仍受长尾分布问题困扰:与频繁谓词相比,由于标注数据量少,尾部谓词训练成本更高且难以区分。现有的再平衡策略试图通过先验规则处理该问题,但仍局限于预定义条件,难以在不同模型和数据集上扩展。本文提出一种跨模态谓词增强(CaCao)框架,其中学习一个视觉提示语言模型以低资源方式生成多样化的细粒度谓词。所提出的CaCao可以即插即用的方式应用,并自动增强现有SGG以应对长尾问题。在此基础上,我们进一步引入一种用于开放世界谓词场景图生成的新型纠缠跨模态提示方法(Epic),使模型能够以零样本方式泛化到未见谓词。在三个基准数据集上的综合实验表明,CaCao以模型无关的方式持续提升了多个场景图生成模型的性能。此外,我们的Epic在开放世界谓词预测上取得了具有竞争力的性能。本文的数据和代码已公开可用。
引用
@article{arxiv.2303.13233,
title = {Visually-Prompted Language Model for Fine-Grained Scene Graph Generation in an Open World},
author = {Qifan Yu and Juncheng Li and Yu Wu and Siliang Tang and Wei Ji and Yueting Zhuang},
journal= {arXiv preprint arXiv:2303.13233},
year = {2023}
}
备注
Accepted by ICCV 2023