中文

VisorGPT:通过生成式预训练学习视觉先验

计算机视觉与模式识别 2023-05-31 v4

摘要

视觉数据中的各种物体与事物具有特定属性,这些属性可被深度神经网络学习,并在模型中以视觉先验(如物体位置与形状)的形式被隐式表示。此类先验潜在地影响许多视觉任务。例如,在条件图像合成中,不符合先验的空间条件会导致视觉上不准确的合成结果。本工作旨在显式学习视觉先验并实现采样定制。受语言建模进展的启发,我们提出通过生成式预训练学习视觉先验,称为 VisorGPT。通过将物体的视觉位置(如边界框、人体姿态和实例掩码)离散化为序列,VisorGPT 可通过似然最大化对视觉先验建模。此外,我们研究了提示工程以统一各种视觉位置,并从学习到的先验中实现序列输出的定制采样。实验结果表明,VisorGPT 能有效建模视觉先验,可用于许多视觉任务,例如为 ControlNet 等条件图像合成模型定制准确的人体姿态。代码将发布于 https://github.com/Sierkinhane/VisorGPT。

关键词

引用

@article{arxiv.2305.13777,
  title  = {VisorGPT: Learning Visual Prior via Generative Pre-Training},
  author = {Jinheng Xie and Kai Ye and Yudong Li and Yuexiang Li and Kevin Qinghong Lin and Yefeng Zheng and Linlin Shen and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2305.13777},
  year   = {2023}
}

备注

Project web-page: https://sierkinhane.github.io/visor-gpt/