基于 Stable Diffusion 的高度个性化文本嵌入图像操控方法
计算机视觉与模式识别
2023-04-20 v3 人工智能
摘要
扩散模型在图像生成与操控中展现出优越性能,但其固有的随机性给保留和操控图像内容与身份带来了挑战。尽管 DreamBooth 和 Textual Inversion 等先前方法提出了模型或隐表示个性化以维持内容,但它们对多张参考图像和复杂训练的依赖限制了实用性。本文中,我们提出一种简单却高效的个性化方法,通过分解 CLIP 嵌入空间以实现个性化和内容操控,使用高度个性化(HiPer)文本嵌入。我们的方法无需模型微调或标识符,仅用单张图像和目标文本即可操控背景、纹理与运动。通过在多样化目标文本上的实验,我们证明了该方法能在广泛任务中产生高度个性化且复杂的语义图像编辑。我们认为,本工作对文本嵌入空间的新颖理解有潜力启发各类任务中的进一步研究。
引用
@article{arxiv.2303.08767,
title = {Highly Personalized Text Embedding for Image Manipulation by Stable Diffusion},
author = {Inhwa Han and Serin Yang and Taesung Kwon and Jong Chul Ye},
journal= {arXiv preprint arXiv:2303.08767},
year = {2023}
}