用于零样本外观迁移的跨图像注意力
计算机视觉与模式识别
2023-11-07 v1 图形学
摘要
文本到图像生成模型近期的进展已展现出捕捉图像深层语义理解的显著能力。在本工作中,我们利用这一语义知识,在共享相似语义但形状可能显著不同的物体之间迁移视觉外观。为此,我们基于这些生成模型的自注意力层,引入一种跨图像注意力机制,该机制隐式地建立跨图像的语义对应。具体而言,给定一对图像——一张描绘目标结构,另一张指定所需外观——我们的跨图像注意力将对应于结构图像的查询(queries)与外观图像的键(keys)和值(values)相结合。这一操作在去噪过程中应用时,利用已建立的语义对应生成结合所需结构与外观的图像。此外,为提升输出图像质量,我们借助三种机制,在去噪过程中操纵带噪潜变量或模型内部表示。重要的是,我们的方法是零样本的,无需优化或训练。实验表明,我们的方法在广泛的物体类别上均有效,并对两输入图像间形状、尺寸与视点的变化具有鲁棒性。
引用
@article{arxiv.2311.03335,
title = {Cross-Image Attention for Zero-Shot Appearance Transfer},
author = {Yuval Alaluf and Daniel Garibi and Or Patashnik and Hadar Averbuch-Elor and Daniel Cohen-Or},
journal= {arXiv preprint arXiv:2311.03335},
year = {2023}
}
备注
Project page: https://garibida.github.io/cross-image-attention