基于掩码逻辑 nudging 的提示引导图像编辑:视觉自回归模型中的实现
计算机视觉与模式识别
2026-04-17 v1
摘要
我们解决提示引导图像编辑在视觉自回归模型中的问题。给定源图像和目标文本提示,我们旨在根据目标提示修改源图像,同时保留与所需编辑无关的所有区域。为此,我们提出掩码逻辑 nudging,该方法利用源图像 token 图谱引入指导步骤,将模型在目标提示下的预测与这些源 token 图谱对齐。具体而言,我们将固定的源编码转换为逻辑分数,通过 VAR 编码方式,将模型预测的逻辑分数 nudged 向目标,以沿由源-目标提示定义的语义轨迹移动。编辑仅在通过专用掩码方案获取的空间掩码内应用。该方案利用源提示与编辑后提示之间的注意力差异。随后,我们引入一种细化方法以纠正量化误差并提高重建质量。我们的方法在 PIE 数据集上以 512 像素和 1024 像素分辨率实现最佳图像编辑性能。除编辑外,我们的方法还能提供可靠的重建,并在 COCO 数据集上以 512 像素和 OpenImages 数据集上以 1024 像素分辨率超越先前方法。总体而言,我们的方法在 VAR 类方法中表现出色,甚至在速度上远超扩散模型,同时实现了可比或更好的性能。代码已公开于 'https://github.com/AmirMaEl/MLN'。
引用
@article{arxiv.2604.14591,
title = {Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models},
author = {Amir El-Ghoussani and Marc Hölle and Gustavo Carneiro and Vasileios Belagiannis},
journal= {arXiv preprint arXiv:2604.14591},
year = {2026}
}
备注
Accepted at the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings (CVPRF)