面向指令引导的图像编辑的视觉自回归建模
计算机视觉与模式识别
2026-02-09 v2 多媒体
摘要
近期扩散模型的进展为指令引导的图像编辑带来了显著的视觉保真度。然而,其全局去噪过程本质上会将编辑区域与整个图像上下文耦合,从而导致意外的冗余修改并影响对编辑指令的遵循程度。相比之下,自回归模型提供了一种不同的方法,通过在离散视觉标记上顺序化图像合成来实现。其因果和组合机制自然规避了基于扩散的方法在遵循方面的挑战。本文提出 VAREdit,一种视觉自回归 (VAR) 框架,将图像编辑重新表述为下一个尺度预测问题。以源图像特征和文本指令为条件,VAREdit 生成多尺度目标特征以实现精确编辑。本范式的核心挑战在于如何有效地对源图像标记进行条件化。我们观察到,最细尺度的源特征无法有效指导较粗尺度目标特征的预测。为弥合这一差距,我们引入比例对齐参考 (Scale-Aligned Reference, SAR) 模块,将尺度匹配的条件信息注入第一个自注意力层。VAREdit 在编辑遵循度和效率方面均实现了显著的提升。在 EMU-Edit 和 PIE-Bench 数据集上,VAREdit 相对于领先的扩散方法在 CLIP 和 GPT 分数上均实现了大幅提升。此外,VAREdit 仅需 1.2 秒即可完成 512×512 的图像编辑,速度比同样规模的 UltraEdit 快 2.2 倍。代码已公开:https://github.com/HiDream-ai/VAREdit。
引用
@article{arxiv.2508.15772,
title = {Visual Autoregressive Modeling for Instruction-Guided Image Editing},
author = {Qingyang Mao and Qi Cai and Yehao Li and Yingwei Pan and Mingyue Cheng and Ting Yao and Qi Liu and Tao Mei},
journal= {arXiv preprint arXiv:2508.15772},
year = {2026}
}
备注
ICLR 2026; Source codes and models are available at https://github.com/HiDream-ai/VAREdit