中文

面向野外场景的基于示范的语义图像合成的外观匹配适配器

计算机视觉与模式识别 2025-03-19 v2

摘要

基于示范的语义图像合成在保持示范图像外观的同时生成符合语义内容的图像。传统结构引导模型如ControlNet仅依赖文本提示控制外观,无法利用示范图像作为输入。近期无调参方法通过扩张自注意力机制中的隐式跨图像匹配实现局部外观迁移,但先前工作常限于单对象或前景对象外观迁移,难以处理多对象复杂场景。为此,我们提出AM-Adapter(外观匹配适配器),解决野外场景的示范图像语义图像合成,实现从单场景图像的多对象外观迁移。AM-Adapter自动从场景级输入传递局部外观,提供用户将特定细节映射到合成图像中特定位置的可控性。我们的可学习框架通过整合分割图语义信息增强扩张自注意力中的跨图像匹配。为解耦生成与匹配,我们采用阶段性训练:先训练结构引导和生成网络,再冻结其他网络仅训练匹配适配器。推理时,我们引入自动化示范检索方法高效选择示范图像-分割图对。尽管使用极少的可学习参数,AM-Adapter在语义对齐和局部外观保真度方面实现了最佳性能。广泛的消融实验验证了设计选择。代码和模型权重将公开:https://cvlab-kaist.github.io/AM-Adapter/

关键词

引用

@article{arxiv.2412.03150,
  title  = {Appearance Matching Adapter for Exemplar-based Semantic Image Synthesis in-the-Wild},
  author = {Siyoon Jin and Jisu Nam and Jiyoung Kim and Dahyun Chung and Yeong-Seok Kim and Joonhyung Park and Heonjeong Chu and Seungryong Kim},
  journal= {arXiv preprint arXiv:2412.03150},
  year   = {2025}
}