中文

IMProv:基于修复的多模态提示用于计算机视觉任务

计算机视觉与模式识别 2023-12-05 v1

摘要

上下文学习允许在测试时根据任务描述调整模型以适应新任务。在本文中,我们提出IMProv——一种生成模型,能够从多模态提示中上下文学习视觉任务。给定视觉任务的文本描述(例如“左:输入图像,右:前景分割”)、一些输入-输出视觉示例,或两者兼有,该模型通过上下文学习解决新测试输入的任务。我们在一个由计算机视觉论文中的图表及其相关标题组成的新数据集上,以及一个带标题的大规模图像-文本数据集上,训练了一个掩码生成变换器。在推理时,我们用文本和/或图像任务示例提示模型,并让模型修复相应的输出。我们表明,使用文本条件训练模型并扩大数据集规模,可将计算机视觉任务的上下文学习性能提升:前景分割AP提高超过10%,单目标检测AP提高超过5%,着色LPIPS降低近20%。我们的实证结果表明,视觉和语言提示是互补的,同时使用两者有利于获得更好的上下文学习性能。项目页面见https://jerryxu.net/IMProv。

关键词

引用

@article{arxiv.2312.01771,
  title  = {IMProv: Inpainting-based Multimodal Prompting for Computer Vision Tasks},
  author = {Jiarui Xu and Yossi Gandelsman and Amir Bar and Jianwei Yang and Jianfeng Gao and Trevor Darrell and Xiaolong Wang},
  journal= {arXiv preprint arXiv:2312.01771},
  year   = {2023}
}

备注

Project page: https://jerryxu.net/IMProv