利用视觉上下文调制提示改进扩散模型中的上下文学习
计算机视觉与模式识别
2023-12-05 v1
摘要
鉴于上下文学习在大型语言模型中取得的显著成功,其向视觉领域的潜在扩展,特别是与 Stable Diffusion 等视觉基础模型的结合,引起了广泛关注。现有的视觉上下文学习方法经常面临预训练成本高昂、框架受限、视觉理解不充分以及对新任务适应性有限等障碍。针对这些挑战,本研究提出了改进的 Prompt Diffusion (iPromptDiff)。iPromptDiff 集成了一个端到端训练的视觉编码器,将视觉上下文转换为嵌入向量。该向量随后用于调制文本提示的 token 嵌入。我们表明,当配备这种视觉上下文调制的文本引导和标准 ControlNet 结构时,基于扩散的视觉基础模型在各种训练任务中表现出通用性和鲁棒性,并在法线到图像或图像到线条等新颖视觉任务的上下文学习中表现优异。这些能力的有效性在很大程度上依赖于深度的视觉理解,这是通过我们提出的上下文学习架构处理相关视觉演示来实现的。
引用
@article{arxiv.2312.01408,
title = {Improving In-Context Learning in Diffusion Models with Visual Context-Modulated Prompts},
author = {Tianqi Chen and Yongfei Liu and Zhendong Wang and Jianbo Yuan and Quanzeng You and Hongxia Yang and Mingyuan Zhou},
journal= {arXiv preprint arXiv:2312.01408},
year = {2023}
}