针对定制图像生成的解缠与丰富视觉提示
计算机视觉与模式识别
2024-10-29 v2
摘要
在图像生成领域,从视觉提示中创建定制图像并伴随额外文本指令的研究引人瞩目。然而,现有方法(无论是基于调谐的还是无调谐的)在从视觉提示中解读主体-essential 属性方面都难以处理,这导致主体无关属性渗透到生成过程中,最终损害了在可编辑性和 ID 保存方面的个性化质量。本文提出了 DisEnvisioner,一种新方法,有效提取和丰富主体-essential 特征,同时过滤掉无关信息,以实现卓越的定制化性能,完全无需调谐,且仅需单张图像。具体而言,主体特征与其他无关组件被有效分离到不同的视觉 token 中,从而实现更精确的定制化。旨在进一步提高 ID 一致性,我们对解缠特征进行丰富处理,将其塑造成更细粒度的表示。实验表明,我们的方法在指令响应(可编辑性)、ID 一致性、推理速度和整体图像质量方面优于现有方法,凸显了 DisEnvisioner 的有效性与效率。项目页面: https://disenvisioner.github.io/。
引用
@article{arxiv.2410.02067,
title = {DisEnvisioner: Disentangled and Enriched Visual Prompt for Customized Image Generation},
author = {Jing He and Haodong Li and Yongzhe Hu and Guibao Shen and Yingjie Cai and Weichao Qiu and Ying-Cong Chen},
journal= {arXiv preprint arXiv:2410.02067},
year = {2024}
}
备注
The first two authors contributed equally. Project page: https://disenvisioner.github.io/