中文

SliderEdit:基于细粒度指令控制的连续图像编辑

计算机视觉与模式识别 2025-11-14 v1

摘要

指令驱动的图像编辑模型最近取得了显著的性能,使能够从多指令提示中对输入图像进行复杂编辑。然而,这些模型对提示中每个指令的施加强度固定,限制了用户精确和连续控制各个编辑强度的能力。我们引入SliderEdit,一个实现细粒度、可解释指令控制的连续图像编辑框架。给定多部分编辑指令,SliderEdit解缪各个指令,暴露每个指令作为全局训练的滑块,允许平滑调整其强度。与先前在文本到图像生成中引入滑块式属性控制的工作不同,后者通常需要为每个属性或概念进行独立的训练或微调;我们的 метод学习一套低秩适配矩阵,这些矩阵可推广到各种编辑、属性和组合指令上。这使得能够在保持空间局部性和全局语义一致性的同时,对单个编辑维度进行连续插值。我们将SliderEdit应用于包括FLUX-Kontext和Qwen-Image-Edit在内的先进图像编辑模型,观察到在编辑可控性、视觉一致性和用户可调性方面获得显著改进。据我们所知,我们是首次探索和提出用于指令驱动图像编辑模型中连续、细粒度指令控制的框架。我们的成果为实现具有连续和组合控制的交互式、指令驱动图像操作之路。

关键词

引用

@article{arxiv.2511.09715,
  title  = {SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control},
  author = {Arman Zarei and Samyadeep Basu and Mobina Pournemat and Sayan Nag and Ryan Rossi and Soheil Feizi},
  journal= {arXiv preprint arXiv:2511.09715},
  year   = {2025}
}