中文

概念镖:基于组成表示移植的数字图像编辑

计算机视觉与模式识别 2025-04-04 v1 人工智能 计算与语言

摘要

扩散模型广泛用于图像编辑任务。现有编辑方法常通过构建文本嵌入或评分空间中的编辑方向来设计表示操控程序,但面临一个关键挑战:过高的编辑强度会损害视觉一致性,而过低的编辑强度则无法完成编辑任务。值得注意的是,每个源图像可能需要不同的编辑强度,通过 trial-and-error 搜索合适的强度代价高昂。为此,我们提出概念镖(Concept Lancet, CoLan),一个面向扩散式图像编辑的零样态即插即用框架,用于原则化的表示操控。在推理阶段,我们将源输入在潜在(文本嵌入或扩散评分)空间中分解为视觉概念表示的稀疏线性组合。这允许我们准确估计每个图像中概念的存在,从而指导编辑。基于编辑任务(替换/添加/移除),我们执行定制化的概念移植过程,以施加相应的编辑方向。为充分建模概念空间,我们构建了包含多样化视觉术语与短语描述的概念表示数据集 CoLan-150K。在多个扩散式图像编辑基线上实验表明,配备 CoLan的方法在编辑效果与一致性保持方面实现了最佳性能。

关键词

引用

@article{arxiv.2504.02828,
  title  = {Concept Lancet: Image Editing with Compositional Representation Transplant},
  author = {Jinqi Luo and Tianjiao Ding and Kwan Ho Ryan Chan and Hancheng Min and Chris Callison-Burch and René Vidal},
  journal= {arXiv preprint arXiv:2504.02828},
  year   = {2025}
}

备注

Accepted in CVPR 2025. Project page at https://peterljq.github.io/project/colan