利用 K 稀疏自编码器实现测试时可控生成的概念引导器
计算机视觉与模式识别
2025-10-14 v3
摘要
尽管文本到图像生成模型取得了显著进展,但它们容易受到对抗性攻击,不经意地生成不安全或不道德的内容。现有方法通常依赖微调模型以移除特定概念,这种做法计算成本高、可扩展性差,可能也会损害生成质量。本文提出了一种新框架,利用 k 稀疏自编码器 (k-SAEs) 实现对扩散模型中概念的高效和可解释的操控。具体而言,我们首先在文本嵌入的潜空间中识别可解释的单语义概念,并利用它们在给定概念(例如裸露)附近或远离,或引入新概念(例如摄影风格)时精确引导生成——全部在测试时完成。通过大量实验,我们展示了该方法非常简单,不需要重新训练基础模型或 LoRA 适配器,不会损害生成质量,并且对对抗性提示操控具有鲁棒性。我们的方法在不安全概念移除方面实现了 的改进,在风格操控方面效果显著,速度比当前最先进方法快约 倍。代码已公开:https://github.com/kim-dahye/steerers
引用
@article{arxiv.2501.19066,
title = {Concept Steerers: Leveraging K-Sparse Autoencoders for Test-Time Controllable Generations},
author = {Dahye Kim and Deepti Ghadiyaram},
journal= {arXiv preprint arXiv:2501.19066},
year = {2025}
}
备注
23 pages, 18 figures