图像以图像言说:面向上下文视觉学习的通用画师模型
计算机视觉与模式识别
2023-03-27 v2
摘要
上下文学习作为 NLP 中的新范式,使模型仅通过少量提示与示例即可快速适应各类任务。但在计算机视觉中,上下文学习的困难在于各任务在输出表示上差异显著,因此尚不清楚如何定义视觉模型能够理解并迁移至域外任务的通用任务提示。本工作中,我们提出通用模型 Painter,以“图像”为中心的方案克服这些障碍,即:将核心视觉任务的输出重定义为图像,并将任务提示也指定为图像。基于此思想,我们的训练过程极为简单,仅对输入与输出图像对的拼接执行标准掩码图像建模。这使模型能够基于可见图像块执行条件任务。因此,在推理时,我们可采用同一任务的一对输入与输出图像作为输入条件,以指示执行何种任务。无需额外技巧,我们的通用 Painter 在从高层视觉理解到低层图像处理的七项代表性视觉任务上,即可与成熟的专用模型取得相当的性能。此外,Painter 在多项具有挑战性的任务上显著优于近期通用模型。
引用
@article{arxiv.2212.02499,
title = {Images Speak in Images: A Generalist Painter for In-Context Visual Learning},
author = {Xinlong Wang and Wen Wang and Yue Cao and Chunhua Shen and Tiejun Huang},
journal= {arXiv preprint arXiv:2212.02499},
year = {2023}
}
备注
Accepted to CVPR 2023. Code and model is available at: https://github.com/baaivision/Painter