GIDE:精准无训练图像编辑的扩散LLM
计算机视觉与模式识别
2026-03-24 v1
摘要
尽管扩散大型语言模型(DLLM)在多模态生成方面展现出惊人的能力,但进行精确、无训练的图像编辑仍是一个开放挑战。与连续扩散模型不同,DLLM固有的离散分词会阻碍标准噪声反转技术的应用,常导致编辑时结构退化。在本文中,我们引入GIDE(Grounded Inversion for DLLM Image Editing),一个统一的框架,旨在填补这一差距。GIDE包含一种新颖的离散噪声反转机制,准确捕获离散token空间中潜在噪声模式,确保高保真重建。我们随后将编辑管线分解为 grounding、inversion和refinement三个阶段。该设计使GIDE支持各种编辑指令(文本、点和框)和操作,同时严格保留未编辑的背景。此外,为克服现有单步骤评估协议的局限性,我们引入GIDE-Bench,一个严格的基准,包含805个由多模态输入引导的组合编辑情景。广泛实验表明,GIDE在GIDE-Bench上显著优于先前无训练方法,在语义正确性提升51.83%,在感知质量提升50.39%。额外评估在ImgEdit-Bench上确认了其广泛适用性,显示相较于训练基线持续获益,呈现与领先模型相当的照片级一致性。
引用
@article{arxiv.2603.21176,
title = {GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing},
author = {Zifeng Zhu and Jiaming Han and Jiaxiang Zhao and Minnan Luo and Xiangyu Yue},
journal= {arXiv preprint arXiv:2603.21176},
year = {2026}
}
备注
25 pages, 7 figures