中文

指令引导的多目标图像编辑:数量与布局一致性

计算机视觉与模式识别 2025-09-30 v1

摘要

基于标准 CLIP 文本编码器的指令驱动图像编辑在包含大量目标的复杂场景中常常失效。我们提出 QL-Adapter,一个面向多目标编辑的框架,用于应对两个挑战:强制目标数量与空间布局的一致性,以及适应多样化的目标类别。QL-Adapter 由两个核心模块组成:图像-布局融合模块(ILFM)和跨模态增强模块(CMAM)。ILFM 将布局先验与 CLIP 图像编码器的 ViT 补丁 token 融合,以强化空间结构理解。CMAM 将图像特征注入文本分支,以丰富文本嵌入并提升指令遵循能力。我们进一步构建了 QL-Dataset,一个涵盖广泛类别、布局和数量变化的基准数据集,并定义了数量与布局一致的图像编辑任务(QL-Edit)。大量实验表明,QL-Adapter 在 QL-Edit 上达到了最先进的性能,并显著优于现有模型。

关键词

引用

@article{arxiv.2509.24514,
  title  = {Instruction Guided Multi Object Image Editing with Quantity and Layout Consistency},
  author = {Jiaqi Tan and Fangyu Li and Yang Liu},
  journal= {arXiv preprint arXiv:2509.24514},
  year   = {2025}
}