稀疏性即关键:从潜在结构中解锁离分布检测的新见解
计算机视觉与模式识别
2026-04-30 v1
摘要
稀疏自动编码器 (SAE) 已在解释 大语言模型 (LLM) 时显示出显著成功, 通过将稠密表示分解为稀疏、语义组件。然而,其应用于 Vision Transformer (ViT) 的潜力仍 largely 未被探索。本文首次将 SAEs 应用于 ViT [CLS] token 进行 离分布检测 (OOD), 以解决依赖 高度 entangled 特征表示的现有方法的局限性。我们提出了一种新框架,利用 Top-k SAE 将稠密 [CLS] 特征解耦为结构化潜在空间。通过该分析,我们揭示 In-distribution (ID) 数据具有一致的、类别特定的激活模式,我们将其形式化为 类激活概况 (CAP)。我们的研究发现:虽然 ID 样本在 CAP 中保持稳定的模式,但 OOD 样本则系统性地破坏这一结构。基于此洞察,我们引入基于核心能量概况发散的评分函数,以量化其偏离理想激活概况的程度。该方法在 FPR95 指标上取得优异成绩,这一指标对 安全敏感应用至关重要,覆盖多个基准测试,同时也实现了具竞争力的 AUROC。总体而言,我们的发现表明, SAEs 揭示的稀疏、解耦特征可作为 强大、可解释的工具,用于视觉模型的稳健 OOD 检测。
引用
@article{arxiv.2604.26409,
title = {Sparsity as a Key: Unlocking New Insights from Latent Structures for Out-of-Distribution Detection},
author = {Ahyoung Oh and Wonseok Shin and Songkuk Kim},
journal= {arXiv preprint arXiv:2604.26409},
year = {2026}
}
备注
8 pages, 6 figures, supplementary material included, CVPR 2026