TIDE:用于图像生成中可解释扩散Transformer的时间感知稀疏自编码器
计算机视觉与模式识别
2025-08-13 v2 人工智能
多媒体
摘要
与基于 U-Net 的扩散架构相比,Diffusion Transformers (DiTs) 是一类强大但尚未被充分探索的生成模型。我们提出了 TIDE——用于可解释扩散Transformer的时间感知稀疏自编码器——这是一个旨在提取 DiTs 中跨时间步的稀疏、可解释激活特征的框架。TIDE 有效地捕获了随时间变化的表示,并揭示了 DiTs 在大规模预训练期间自然地学习层次语义(例如,3D结构、物体类别和细粒度概念)。实验表明,TIDE 在保持合理生成质量的同时增强了可解释性和可控性,从而支持安全图像编辑和风格迁移等应用。
引用
@article{arxiv.2503.07050,
title = {TIDE : Temporal-Aware Sparse Autoencoders for Interpretable Diffusion Transformers in Image Generation},
author = {Victor Shea-Jay Huang and Le Zhuo and Yi Xin and Zhaokai Wang and Fu-Yun Wang and Yuchi Wang and Renrui Zhang and Peng Gao and Hongsheng Li},
journal= {arXiv preprint arXiv:2503.07050},
year = {2025}
}