SALVE:稀疏自编码器-潜在向量编辑用于神经网络的机械控制
机器学习
2026-03-10 v2 人工智能
计算机视觉与模式识别
摘要
深度神经网络取得了令人瞩目的性能,但仍难以解释和控制。我们提出 SALVE(稀疏自编码器-潜在向量编辑),一个统一的“发现、验证、控制”框架,连接机械可解释性和模型编辑。通过 正则化自编码器,我们在无监督情况下学习稀疏、模型原生特征基。我们采用 Grad-FAM 进行特征级可解释性映射,以可视化方式将潜在特征 grounding 在输入数据上。利用自编码器的结构,我们执行精确且持久的权重空间干预,实现对类别定义特征和跨类别特征的连续调制。我们进一步推导出关键抑制阈值 ,量化每个类别对其主导特征的依赖程度,支持细粒度鲁棒性诊断。我们的方法在卷积(ResNet-18)和基于变换器(ViT-B/16)模型上均得到验证,展示了对其行为实现一致、可解释的控制。本工作为将特征发现转化为可操作模型编辑提供了原则方法,推动了透明和可控 AI 系统的发展。
引用
@article{arxiv.2512.15938,
title = {SALVE: Sparse Autoencoder-Latent Vector Editing for Mechanistic Control of Neural Networks},
author = {Vegard Flovik},
journal= {arXiv preprint arXiv:2512.15938},
year = {2026}
}
备注
Accepted to ICLR 2026, Trustworthy AI Workshop