LeftRefill:基于左侧参考通过通用文本到图像扩散模型填充右侧画布
计算机视觉与模式识别
2024-03-05 v3
摘要
本文介绍 LeftRefill,一种高效利用大型文本到图像(T2I)扩散模型进行参考引导图像合成的创新方法。顾名思义,LeftRefill 将参考视图与目标视图水平拼接为整体输入。参考图像占据左侧,目标画布位于右侧。随后,LeftRefill 基于左侧参考与特定任务指令绘制右侧目标画布。此类任务表述与上下文修复有一定相似性,类似于人类画师的行动。这一新颖表述无需其他图像编码器或适配器即可高效学习参考与目标间的结构与纹理对应关系。我们通过 T2I 模型中的交叉注意力模块注入任务与视图信息,并借助重排的自注意力模块进一步展现多视图参考能力。这些使 LeftRefill 能够作为通用模型执行一致生成,无需测试时微调或模型修改。因此,LeftRefill 可视为一个简单而统一的框架,用以解决参考引导合成问题。作为示例,我们基于预训练的 StableDiffusion,利用 LeftRefill 解决两个不同挑战:参考引导修复与新视角合成。代码与模型发布于 https://github.com/ewrfcas/LeftRefill。
引用
@article{arxiv.2305.11577,
title = {LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion Model},
author = {Chenjie Cao and Yunuo Cai and Qiaole Dong and Yikai Wang and Yanwei Fu},
journal= {arXiv preprint arXiv:2305.11577},
year = {2024}
}
备注
Accepted by CVPR2024. Codes and models are released at https://github.com/ewrfcas/LeftRefill, Project page: https://ewrfcas.github.io/LeftRefill