类比:基于图像扩散模型的类比式视觉零样本学习
计算机视觉与模式识别
2024-05-17 v1 图形学
摘要
视觉零样本学习(Visual In-Context Learning, ICL)因其通过类比推理在有限示例对的情况下完成多种任务的能力,成为一个引人注目的研究领域。然而,基于训练的视觉ICL在泛化到未见任务方面存在局限,还需要收集多样化的任务数据集。另一方面,现有基于推理的视觉ICL方法仅依赖文本提示,无法捕捉给定示例中细粒度的上下文信息,且在从图像转换为文本提示时可能效率低下。为此,我们提出了Analogist,这是一种新颖的基于推理的视觉ICL方法,利用面向图像填充预训练的文本到图像扩散模型,同时运用视觉和文本提示技术。对于视觉提示,我们提出了自注意力克隆(Self-Attention Cloning, SAC)方法,以引导图像示例之间在细粒度结构层面的类比。对于文本提示,我们利用GPT-4V的视觉推理能力高效生成文本提示,并引入交叉注意力掩码(Cross-Attention Masking, CAM)操作,以增强由文本提示引导的语义层面类比的准确性。我们的方法无需微调或优化,开箱即用,且通用且灵活,能够以零样本方式执行广泛的视觉任务。大量实验表明,我们的方法在定性和定量分析方面均优于现有方法。
引用
@article{arxiv.2405.10316,
title = {Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model},
author = {Zheng Gu and Shiyuan Yang and Jing Liao and Jing Huo and Yang Gao},
journal= {arXiv preprint arXiv:2405.10316},
year = {2024}
}
备注
Project page: https://analogist2d.github.io