超越编辑对:基于多尺度可学习区域的细粒度指令式图像编辑
计算机视觉与模式识别
2025-05-27 v1
摘要
当前的文本驱动图像编辑方法通常遵循两个方向之一:依赖大规模、高质量的编辑对数据集来提高编辑精度和多样性,或探索无数据集的替代技术。然而,构建大规模编辑数据集需要精心设计的流程,耗时费力,且常产生不真实的样本或不需要的伪影。同时,无数据集方法可能受限于有限的指令理解能力和受限的编辑能力。面对这些挑战,本研究开发了一种新的指令驱动图像编辑范式,该范式利用广泛可用且海量的文本-图像对,而不是依赖编辑对数据集。我们的方法引入了多尺度可学习区域,以定位和指导编辑过程。通过将图像与其文本描述之间的对齐作为监督,并学习生成特定任务的编辑区域,我们的方法实现了高保真、精确且与指令一致的图像编辑。大量实验表明,所提出的方法在各种任务和基准测试中均取得了最先进的性能,同时对各种类型的生成模型展现出强大的适应性。
引用
@article{arxiv.2505.19352,
title = {Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions},
author = {Chenrui Ma and Xi Xiao and Tianyang Wang and Yanning Shen},
journal= {arXiv preprint arXiv:2505.19352},
year = {2025}
}