KV Inversion:面向文本条件真实图像动作编辑的 KV 嵌入学习
计算机视觉与模式识别
2023-09-29 v1
摘要
文本条件图像编辑是近年来出现且极具实用性的任务,其潜力不可估量。然而,多数同期方法无法执行动作编辑,即它们无法生成既符合编辑提示的动作语义又保留原图像内容的结果。为解决动作编辑问题,我们提出 KV Inversion,一种可实现满意重建性能与动作编辑的方法,其能解决两大问题:1) 编辑结果可匹配相应动作;2) 被编辑对象可保留原始真实图像的纹理与身份。此外,我们的方法无需训练 Stable Diffusion 模型本身,也无需扫描大规模数据集以进行耗时的训练。
引用
@article{arxiv.2309.16608,
title = {KV Inversion: KV Embeddings Learning for Text-Conditioned Real Image Action Editing},
author = {Jiancheng Huang and Yifan Liu and Jin Qin and Shifeng Chen},
journal= {arXiv preprint arXiv:2309.16608},
year = {2023}
}