中文

LouvreSAE:用于可解释且可控风格迁移的稀疏自编码器

计算机视觉与模式识别 2025-12-23 v1 人工智能 图形学

摘要

生成模型中的艺术风格迁移仍是一个重大挑战,因为现有方法通常仅通过模型微调、额外适配器或提示工程引入风格,所有这些方法都可能计算昂贵且仍可能使风格与主题内容交织在一起。本文引入一种训练和推理都轻便、可解释的方法,用于表示和迁移艺术风格。我们利用建立在生成图像模型潜在嵌入之上的艺术特定稀疏自编码器(SAE)。在艺术数据上训练后,我们的 SAE 学习了一组大致解耦的风格和组成概念,这些概念对应于与笔触、纹理和颜色调色板相关的风格元素,以及与语义和结构概念相关的概念。我们称其为 LouvreSAE,并使用它构建风格轮廓:紧凑、可分解的驾驶向量,无需任何模型更新或优化即可实现风格迁移。与先前基于概念的风格迁移方法不同,我们的方法无需微调、无需 LoRA 训练,也无需额外的推理步骤,从而仅通过少量参考图像即可直接驾驶艺术风格。我们在 ArtBench10 上进行了验证,在风格评估(VGG 风格损失和 CLIP Score Style)方面实现或超越了现有方法,同时速度快 1.7 倍至 20 倍,关键的是具有可解释性。

关键词

引用

@article{arxiv.2512.18930,
  title  = {LouvreSAE: Sparse Autoencoders for Interpretable and Controllable Style Transfer},
  author = {Raina Panda and Daniel Fein and Arpita Singhal and Mark Fiore and Maneesh Agrawala and Matyas Bohacek},
  journal= {arXiv preprint arXiv:2512.18930},
  year   = {2025}
}