中文

视觉上下文提示

计算机视觉与模式识别 2023-11-23 v1 人工智能 机器学习

摘要

大语言模型(LLMs)中的上下文提示已成为提升零样本能力的主流方法,但该思想在视觉领域较少被探索。现有视觉提示方法聚焦于指代分割以分割最相关对象,难以应对开放集分割与检测等许多通用视觉任务。本文引入一种面向这两类任务的通用视觉上下文提示框架。具体而言,我们基于编码器-解码器架构构建,并开发了一种支持笔画、框和点等多种提示的多功能提示编码器。我们进一步将其增强为可接受任意数量的参考图像分割作为上下文。我们广泛的探索表明,所提出的视觉上下文提示激发了非凡的指代与通用分割能力以进行指代与检测,在闭集域内数据集上取得有竞争力的性能,并在许多开放集分割数据集上展示出 promising 结果。通过在 COCO 与 SA-1B 上联合训练,我们的模型在 COCO 上达到 57.757.7 PQ,在 ADE20K 上达到 23.223.2 PQ。代码将发布于 https://github.com/UX-Decoder/DINOv。

关键词

引用

@article{arxiv.2311.13601,
  title  = {Visual In-Context Prompting},
  author = {Feng Li and Qing Jiang and Hao Zhang and Tianhe Ren and Shilong Liu and Xueyan Zou and Huaizhe Xu and Hongyang Li and Chunyuan Li and Jianwei Yang and Lei Zhang and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2311.13601},
  year   = {2023}
}

备注

technical report