中文

ViStruct:通过课程引导的代码-视觉表征进行视觉结构知识抽取

计算机视觉与模式识别 2023-11-23 v1 计算与语言 机器学习

摘要

最先进的视觉-语言模型(VLMs)在结构知识抽取(如对象间关系)方面性能仍然有限。本文中,我们提出 ViStruct,一种用于训练 VLM 以进行有效视觉结构知识抽取的训练框架。其中包含两项新颖设计。首先,我们提议利用编程语言固有的结构来刻画视觉结构信息。该方法能够以组织良好的结构化格式,对多粒度(如概念、关系和事件)的视觉结构信息进行显式且一致的表示。其次,我们为 VLM 引入基于课程的学习,以从基础视觉概念到复杂事件结构逐步理解视觉结构。我们的直觉是,低层知识可能有助于复杂视觉结构的理解。此外,我们编译并发布了一套专为视觉结构知识抽取定制的数据集。我们采用弱监督方法,利用网络上丰富的图像- caption 对直接生成视觉事件结构用于 ViStruct 训练。在实验中,我们在视觉结构预测任务上评估 ViStruct,证明了其在提升视觉结构理解方面的有效性。代码已公开于 \url{https://github.com/Yangyi-Chen/vi-struct}。

关键词

引用

@article{arxiv.2311.13258,
  title  = {ViStruct: Visual Structural Knowledge Extraction via Curriculum Guided Code-Vision Representation},
  author = {Yangyi Chen and Xingyao Wang and Manling Li and Derek Hoiem and Heng Ji},
  journal= {arXiv preprint arXiv:2311.13258},
  year   = {2023}
}

备注

Accepted to EMNLP 2023