中文

基于知识感知上下文提示学习的终身场景图生成

计算机视觉与模式识别 2024-01-29 v1

摘要

场景图生成(SGG)旨在预测图像内物体对之间的视觉关系。主流的 SGG 方法通常假设 SGG 采用一次性学习过程。这种传统范式可能需要在每次出现新关系时对所有先前观察到的样本进行重复训练,以降低遗忘先前获得知识的风险。本工作旨在解决一系列先前关系预测中固有的这一缺陷。受预训练语言模型中上下文学习成就的启发,我们的方法赋予模型预测关系并持续获取新知识的能力,而不会遭受灾难性遗忘。为了实现这一目标,我们引入了一个新颖且实用的场景图生成框架,即终身场景图生成(LSGG),其中任务(如谓词)以流式方式展开。在此框架中,模型被限制在当前任务上进行训练,无法访问先前遇到的训练数据(除了少量样本),但模型的任务是推断迄今为止遇到的所有谓词。严格的实验证明了我们提出的方法在 LSGG 背景下,在多种指标上优于最先进的 SGG 模型。此外,在两个主流基准数据集 VG 和 Open-Image(v6) 上的大量实验表明,我们提出的模型在持续学习和传统设置方面均优于许多有竞争力的 SGG 模型。全面的消融实验证明了我们模型中每个组件的有效性。

关键词

引用

@article{arxiv.2401.14626,
  title  = {Towards Lifelong Scene Graph Generation with Knowledge-ware In-context Prompt Learning},
  author = {Tao He and Tongtong Wu and Dongyang Zhang and Guiduo Duan and Ke Qin and Yuan-Fang Li},
  journal= {arXiv preprint arXiv:2401.14626},
  year   = {2024}
}