基于类自适应交叉注意力的语义图像合成
计算机视觉与模式识别
2025-03-31 v3 人工智能
摘要
在语义图像合成中,最先进的方法主要由使用 SPatially-Adaptive DE-normalization(SPADE,空间自适应反归一化)层定制变体的方法主导,这些方法可实现良好的视觉生成质量和编辑灵活性。按设计,此类层学习逐像素调制参数,以根据每个像素所属语义类对生成器激活进行反归一化。因此,它们往往忽略全局图像统计,最终导致不令人信服的局部风格编辑,并引起全局不一致,如颜色或光照分布偏移。此外,SPADE 层需要语义分割掩码以在生成器中映射风格,阻碍了无需人工干预的形状操控。为此,我们设计了一种新颖架构,用交叉注意力层替代 SPADE 来学习形状-风格关联,从而调节图像生成过程。我们的模型继承了 SPADE 的灵活性,同时获得了最先进的生成质量,以及改进的全局与局部风格迁移。代码与模型见 https://github.com/TFonta/CA2SIS。
引用
@article{arxiv.2308.16071,
title = {Semantic Image Synthesis via Class-Adaptive Cross-Attention},
author = {Tomaso Fontanini and Claudio Ferrari and Giuseppe Lisanti and Massimo Bertozzi and Andrea Prati},
journal= {arXiv preprint arXiv:2308.16071},
year = {2025}
}
备注
Code and models available at https://github.com/TFonta/CA2SIS The paper is under consideration at Computer Vision and Image Understanding