探索稀疏自编码器在视觉模型中的表征能力
计算机视觉与模式识别
2025-09-19 v2 机器学习
摘要
稀疏自编码器(Sparse Autoencoders, SAEs)已成为解释大型语言模型(LLMs)隐藏状态的流行工具。通过学习从稀疏瓶颈层重构激活值,SAEs 从高维内部表示中发现可解释特征。尽管在语言模型领域取得成功,SAEs 在视觉领域的研究仍不充分。本文对 SAEs 在视觉模型中的表征能力进行广泛评估,涵盖多种图像基任务。实验结果表明,SAEs 提取的特征在语义上具有意义,能提升跨域泛化性能,并支持跨三种视觉模型架构(视觉嵌入模型、多模态大型语言模型和扩散模型)的可控生成。在视觉嵌入模型中,我们发现所学 SAEs 特征可用于 OOD 检测,并提供证据表明它们恢复了底层模型的本体论结构。对于扩散模型,本文展示 SAEs 能通过文本编码器操作实现语义引导,并构建自动化管道发现人类可解释属性。最后,对多模态大型语言模型进行探索性实验,发现 SAEs 特征揭示了视觉与语言模态之间的共享表征。本研究为视觉模型中的 SAE 评估奠定基础,凸显其在提升可解释性、泛化性和可控性方面的巨大潜力。
引用
@article{arxiv.2508.11277,
title = {Probing the Representational Power of Sparse Autoencoders in Vision Models},
author = {Matthew Lyle Olson and Musashi Hinck and Neale Ratzlaff and Changbai Li and Phillip Howard and Vasudev Lal and Shao-Yen Tseng},
journal= {arXiv preprint arXiv:2508.11277},
year = {2025}
}
备注
ICCV 2025 Findings