编辑文本到图像扩散模型中的隐式假设
计算机视觉与模式识别
2023-08-28 v2
摘要
文本到图像扩散模型在生成图像时常常对世界做出隐式假设。尽管某些假设是有用的(例如天空是蓝色的),但它们也可能过时、错误,或反映了训练数据中存在的社交偏见。因此,需要在不要求显式用户输入或昂贵重新训练的情况下控制这些假设。在本工作中,我们旨在编辑预训练扩散模型中给定的隐式假设。我们的文本到图像模型编辑方法简称为 TIME,接收一对输入:一个是模型做出隐式假设的欠指定“源”提示(例如“一束玫瑰”),以及一个描述相同场景但指定了期望属性的“目标”提示(例如“一束蓝玫瑰”)。TIME 随后更新模型的跨注意力层,因为这些层为文本词元赋予视觉含义。我们编辑这些层中的投影矩阵,使得源提示被投影到接近目标提示。我们的方法非常高效,因为它在一秒内仅修改模型 2.2% 的参数。为评估模型编辑方法,我们引入了 TIMED(TIME 数据集),包含来自不同领域的 147 对源提示与目标提示。我们的实验(使用 Stable Diffusion)表明,TIME 在模型编辑上取得成功,对编辑期间未见的相关提示泛化良好,并对不相关的生成施加最小影响。
引用
@article{arxiv.2303.08084,
title = {Editing Implicit Assumptions in Text-to-Image Diffusion Models},
author = {Hadas Orgad and Bahjat Kawar and Yonatan Belinkov},
journal= {arXiv preprint arXiv:2303.08084},
year = {2023}
}
备注
Project page: https://time-diffusion.github.io/