ZONE:零样本指令引导的局部编辑
计算机视觉与模式识别
2024-04-15 v2
摘要
Stable Diffusion 等视觉语言模型的最新进展在创意图像合成与编辑方面展现了卓越能力。然而,现有大多数文本到图像编辑方法面临两个障碍:首先,需要精心设计文本提示才能获得良好效果,这既不直观也不用户友好;其次,它们对局部编辑不敏感,并可能不可逆地影响非编辑区域,留下明显的编辑痕迹。为解决这些问题,我们提出了一种零样本指令引导的局部图像编辑方法,称为 ZONE。我们首先通过 InstructPix2Pix 将用户提供的指令(例如“把他的领带变成蓝色”)中的编辑意图转换为特定的图像编辑区域。然后,我们提出了一种 Region-IoU 方案,用于从现成的分割模型中精确提取图像图层。我们进一步开发了一种基于 FFT 的边缘平滑器,以实现图层与图像之间的无缝融合。我们的方法允许仅凭单条指令对特定区域进行任意操作,同时保持其余区域不变。大量实验表明,我们的 ZONE 方法取得了出色的局部编辑效果与用户友好性,优于 state-of-the-art 方法。代码可在 https://github.com/lsl001006/ZONE 获取。
引用
@article{arxiv.2312.16794,
title = {ZONE: Zero-Shot Instruction-Guided Local Editing},
author = {Shanglin Li and Bohan Zeng and Yutang Feng and Sicheng Gao and Xuhui Liu and Jiaming Liu and Li Lin and Xu Tang and Yao Hu and Jianzhuang Liu and Baochang Zhang},
journal= {arXiv preprint arXiv:2312.16794},
year = {2024}
}
备注
Accepted at CVPR 2024