UniEdit-I:面向统一视觉语言模型的训练-free 图像编辑框架
计算机视觉与模式识别
2025-12-04 v2
摘要
虽然统一视觉语言模型承诺能够协同利用视觉语言模型的高层语义理解能力与扩散模型的生成保真度,但当前的编辑方法仍然在本质上是解耦且闭环的,仅执行静态、预定义的变换,无法在语义解释与视觉生成之间实现动态反馈。中心限制源于表征差距:理解阶段通常使用高层、语言对齐的编码器,而生成阶段依赖低层、像素空间的自编码器,导致特征空间错位。为弥合这一差距,近期研究如 Representation Autoencoders 和 BLIP3-o 提出直接在预训练语义编码器的高层特征上进行扩散建模。我们发现,在语义潜空间中的编辑会修改概念表征而非像素,从而确保中间结果在语义连贯性和视觉可信度之间取得平衡。基于此洞见,我们提出 UniEdit-I,这是首个在统一 VLM 语义潜空间中完全进行的训练-free、闭环图像编辑框架,通过引入理解-编辑-验证 (UEV) 循环,将 VLM 从事后评估器转变为内在过程指挥官。UniEdit-I 建立了首个语义驱动的自我纠正闭环图像编辑管道。在 GEdit-Bench 上进行的评估表明,UniEdit-I 在无任何微调或架构修改的情况下实现了最先进的性能,甚至超越了多个大规模预训练编辑器。
引用
@article{arxiv.2508.03142,
title = {UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying},
author = {Chengyu Bai and Jintao Chen and Xiang Bai and Yilong Chen and Qi She and Ming Lu and Shanghang Zhang},
journal= {arXiv preprint arXiv:2508.03142},
year = {2025}
}