释放自回归模型进行few-shot图像操纵的上下学习能力
计算机视觉与模式识别
2024-12-04 v2
摘要
文本引导的图像操纵近年来取得了显著的进展。为缓解语言歧义,针对训练集中欠represent或难以纯语言描述的指令,应用了基于视觉示例的few-shot学习。然而,仅凭视觉提示进行学习需要强大的推理能力,而扩散模型在这方面正感到困扰。为此,我们引入一种新型多模态自回归模型,称为\textbf{InstaManip},可通过上下学习即时学习新的图像操纵操作,其结合文本与视觉指引,并可应用于新的查询图像。具体而言,我们提出一种创新的分组自注意力机制,将上下学习过程分为两个独立阶段——学习与应用,该机制将复杂问题简化为两个更易处理的任务。我们还引入一种关系正则化方法,以进一步分离exemplar图像中与无关内容相关的特征。大量实验表明,我们的方法在人类评估中显著优于先前的few-shot图像操纵模型(≥19%)。我们还发现,通过增加exemplar图像的数量或多样性,可进一步提升模型性能。
关键词
引用
@article{arxiv.2412.01027,
title = {Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation},
author = {Bolin Lai and Felix Juefei-Xu and Miao Liu and Xiaoliang Dai and Nikhil Mehta and Chenguang Zhu and Zeyi Huang and James M. Rehg and Sangmin Lee and Ning Zhang and Tong Xiao},
journal= {arXiv preprint arXiv:2412.01027},
year = {2024}
}
备注
18 pages, 16 figures, 5 tables