通过靶向标记调整的稳定扩散中的隐式先验编辑
计算机视觉与模式识别
2024-12-05 v1
摘要
在文本到图像生成任务中,隐式假设和先验条件往往是必不可少的,尤其是在文本提示缺乏足够上下文的情况下。然而,这些假设有时会反映出训练数据中嵌入的过时概念、不准确信息或社会偏见。我们提出了一种名为 Embedit 的方法,通过仅调整词标记嵌入来高效调整模型中隐式假设和先验条件,而不会影响其对无关对象的解释或整体性能。给定包含隐式假设的“源”提示(例如“玫瑰”导致玫瑰为红色),以及指定所需属性的“目标”提示(例如“蓝玫瑰”),Embedit 对目标对象(“玫瑰”)的词标记嵌入(WTE)进行微调,以优化稳定扩散文本编码器的最后一个隐藏状态,这是一种 SOTA 文本到图像模型。这种精准调整可防止对模型知识库中其他对象的意外影响,因为与目标对象无关的 WTE 以及模型权重保持不变。因此,当提示不包含被编辑的对象时,所有表示和模型输出都与原始未编辑模型完全相同。该方法高度高效,仅需对 Stable Diffusion 1.4 修改 768 个参数,对 XL 修改 2048 个参数,匹配各自模型的 WTE 维度。这种最小范围结合快速执行,使 Embedit 在实际应用中高度实用。此外,更改可以通过恢复原始 WTE 层轻松可逆。我们的实验结果表明,Embedit 在各种模型、任务和编辑场景(包括单编辑和顺序多个编辑)中 consistently 优于先前方法,实现至少 6.01% 的提升(从 87.17% 提升至 93.18%)。
引用
@article{arxiv.2412.03400,
title = {Implicit Priors Editing in Stable Diffusion via Targeted Token Adjustment},
author = {Feng He and Chao Zhang and Zhixue Zhao},
journal= {arXiv preprint arXiv:2412.03400},
year = {2024}
}