通过图像修复实现视觉提示
计算机视觉与模式识别
2022-09-02 v1
摘要
如何在不进行特定任务微调或任何模型修改的情况下,使预训练的视觉模型适应新的下游任务?受 NLP 中提示(prompting)的启发,本文研究了视觉提示:在测试时给定新任务的输入-输出图像示例以及一张新输入图像,目标是自动生成与该示例一致的输出图像。我们表明,将这一问题表述为简单的图像修复——字面意义上就是填充拼接的视觉提示图像中的一个空洞——结果出奇地有效,前提是修复算法已在恰当的数据上训练。我们在自行整理的新数据集(来自 Arxiv 上学术论文来源的 88k 张无标签图)上训练了掩码自编码器。我们将视觉提示应用于这些预训练模型,并展示了在多种下游图像到图像任务上的结果,包括前景分割、单目标检测、上色、边缘检测等。
引用
@article{arxiv.2209.00647,
title = {Visual Prompting via Image Inpainting},
author = {Amir Bar and Yossi Gandelsman and Trevor Darrell and Amir Globerson and Alexei A. Efros},
journal= {arXiv preprint arXiv:2209.00647},
year = {2022}
}
备注
Project page: https://yossigandelsman.github.io/visual_prompt