中文

结束标记的奇特案例:使用CLIP进行零样本解耦图像编辑

计算机视觉与模式识别 2024-06-04 v1

摘要

扩散模型在生成高质量图像方面已变得突出。然而,与以解耦方式编辑图像而著称的GAN模型不同,基于扩散的文本到图像模型难以在不损害图像一致性的情况下实现同等水平的精确属性操作。在本文中,常用于流行文本到图像扩散模型(如Stable Diffusion)中的CLIP,能够以零样本方式执行解耦编辑。通过与最先进的编辑方法进行定性和定量比较,我们展示了我们的方法具有竞争力的结果。这一见解可能为将该方法应用于各种任务(包括图像和视频编辑)提供机会,为解耦编辑提供一种轻量级且高效的方法。

关键词

引用

@article{arxiv.2406.00457,
  title  = {The Curious Case of End Token: A Zero-Shot Disentangled Image Editing using CLIP},
  author = {Hidir Yesiltepe and Yusuf Dalva and Pinar Yanardag},
  journal= {arXiv preprint arXiv:2406.00457},
  year   = {2024}
}