中文

CHIMERA:用于零样本图像变形的自适应缓存注入与语义锚点提示及变形导向指标

计算机视觉与模式识别 2026-03-25 v5

摘要

近期基于扩散的图像变形方法通常插值反演潜变量并重用有限的条件信号,这通常会导致异质端点对的不稳定中间结果。具体而言,(i) 特征重用通常是部分或非自适应的,导致突变的结构变化或过度平滑;(ii) 文本条件通常针对每个端点独立获取然后进行插值,这可能引入不兼容的语义。我们提出CHIMERA,一个新颖的零样本扩散变形框架,通过反演引导的去噪和互补特征重用及文本条件来解决上述两个问题。ACI在DDIM反演期间缓存了超出仅Key-Value重用的更广泛的多尺度扩散特征,并通过层和时间步感知的调度重新注入它们,以稳定去噪并实现渐进融合。语义锚点提示(SAP)使用视觉语言模型生成共享锚点提示和锚点条件化的端点提示,并将锚点注入交叉注意力以改善中间语义一致性。最后,我们提出全局-局部一致性得分(GLCS),一种变形导向的指标,联合捕捉全局域协调和局部过渡平滑性。广泛的实验和用户研究表明,CHIMERA比先前方法产生了更平滑且语义更一致的变形,同时保持高效且适用于多种扩散骨干网络而无需重新训练。代码和项目页面将公开发布。

关键词

引用

@article{arxiv.2512.07155,
  title  = {CHIMERA: Adaptive Cache Injection and Semantic Anchor Prompting for Zero-shot Image Morphing with Morphing-oriented Metrics},
  author = {Dahyeon Kye and Jeahun Sung and Minkyu Jeon and Jihyong Oh},
  journal= {arXiv preprint arXiv:2512.07155},
  year   = {2026}
}

备注

Please visit our project page at https://cmlab-korea.github.io/CHIMERA/