中文

Specify and Edit: 克服文本图像编辑中的歧义

计算机视觉与模式识别 2024-07-30 v1 人工智能 机器学习

摘要

文本驱动的编辑扩散模型在用户输入指令存在歧义时表现有限。为解决此问题,我们提出\textit{Specify ANd Edit}(SANE),一种针对扩散基编辑系统的零shot推理管道。我们使用大型语言模型(LLM)将输入指令分解为具体指令,即针对输入图像应用明确定义的干预,以满足用户的请求。我们受益于从LLM派生的指令以及原始指令,归功于专为该任务设计的新型去噪引导策略。我们通过三个基线和两个数据集的实验表明,SANE在所有设置下均能显著提升性能。此外,我们的管道提高了编辑模型的可解释性,并提升了输出多样性。我们还演示了该方法可应用于任何编辑,无论其是否存在歧义。我们的代码已公开于https://github.com/fabvio/SANE。

关键词

引用

@article{arxiv.2407.20232,
  title  = {Specify and Edit: Overcoming Ambiguity in Text-Based Image Editing},
  author = {Ekaterina Iakovleva and Fabio Pizzati and Philip Torr and Stéphane Lathuilière},
  journal= {arXiv preprint arXiv:2407.20232},
  year   = {2024}
}