LLM4SGG:面向弱监督场景图生成的大语言模型
计算机视觉与模式识别
2024-07-30 v8 人工智能
机器学习
摘要
弱监督场景图生成(WSSGG)研究近来作为一种替代完全监督方法的途径而出现,后者严重依赖昂贵的标注。在这方面,WSSGG的研究利用图像描述来获取未定位三元组,同时主要关注于将未定位三元组定位到图像区域上。然而,它们忽视了从描述中形成三元组过程涉及的两个问题:1) 语义过度简化问题,在从描述提取三元组时出现,其中描述中的细粒度谓词被不期望地转换为粗粒度谓词,导致长尾谓词分布;2) 低密度场景图问题,在将描述中的三元组与感兴趣的实体/谓词类对齐时出现,其中许多三元组被丢弃且未用于训练,导致监督不足。为解决这两个问题,我们提出一种新方法,即用于弱监督SGG的大语言模型(LLM4SGG),其中我们通过利用LLM在从描述提取三元组以及将实体/谓词类与目标数据对齐过程中的深入语言理解与推理能力来缓解这两个问题。为进一步使LLM参与这些过程,我们采用思维链(Chain-of-Thought)思想和上下文少样本学习策略。为验证LLM4SGG的有效性,我们在Visual Genome和GQA数据集上进行了大量实验,显示出相比最先进WSSGG方法在Recall@K和mean Recall@K上的显著提升。另一亮点是LLM4SGG具有数据高效性,能够用少量训练图像实现有效模型训练。
引用
@article{arxiv.2310.10404,
title = {LLM4SGG: Large Language Models for Weakly Supervised Scene Graph Generation},
author = {Kibum Kim and Kanghoon Yoon and Jaehyeong Jeon and Yeonjun In and Jinyoung Moon and Donghyun Kim and Chanyoung Park},
journal= {arXiv preprint arXiv:2310.10404},
year = {2024}
}
备注
8 pages; CVPR 2024