中文

无训练多概念图像编辑

计算机视觉与模式识别 2026-03-04 v2

摘要

在严格的无训练约束下对扩散模型进行图像编辑仍是一个重大挑战。虽然最近的基于优化的方法在文本驱动下实现了强大的零样本编辑,但在保持身份特征和捕捉如人脸结构、材料纹理或特定物体几何形状等低于语言抽象层次的细节方面存在困难。为解决这一根本性差距,我们提出了概念蒸馏采样 (Concept Distillation Sampling, CDS)。我们是首次引入一种统一、无训练的框架,用于目标无导向的多概念图像编辑。CDS 通过整合高度稳定的蒸馏主干(包括有序时间步、正则化和负向导师提示),结合动态加权机制,克服了以往方法在语言层面的瓶颈,使其能够在扩散过程中无缝组合和控制多个视觉概念,利用来自预训练 LoRA 适配器的空间感知先验且不产生空间干扰。该方法无需参考所需编辑的样本即可保持实例保真度。广泛的定量和定性评估表明,我们的方法在 InstructPix2Pix 和 ComposLoRA 数据集上均实现了对现有无训练编辑和多 LoRA 组合方法的持续领先性能。代码将公开发布。

关键词

引用

@article{arxiv.2602.20839,
  title  = {Training-Free Multi-Concept Image Editing},
  author = {Niki Foteinopoulou and Ignas Budvytis and Stephan Liwicki},
  journal= {arXiv preprint arXiv:2602.20839},
  year   = {2026}
}

备注

17 pages, 13 figures