中文

叠加态作为有损压缩:用稀疏自编码器测量及其与对抗脆弱性的联系

机器学习 2025-12-16 v1 人工智能

摘要

神经网络通过叠加态实现卓越性能:将多个特征编码为激活空间中的重叠方向,而非为每个特征分配独立的神经元。这给可解释性带来了挑战,但我们缺乏有原则的方法来衡量叠加态。我们提出了一个信息论框架,用于衡量神经表征的有效自由度。我们将 Shannon 熵应用于稀疏自编码器的激活值,以计算有效特征数,即实现无干扰编码所需的最少神经元数。等价地,这衡量了网络通过叠加态模拟了多少“虚拟神经元”。当网络编码的有效特征多于实际神经元时,它们必须接受干扰作为压缩的代价。我们的指标在玩具模型中与真实值高度相关,在算法任务中检测到极小的叠加态,并揭示了在 dropout 下叠加态的系统性减少。逐层模式反映了在 Pythia-70M 上的内在维度研究。该指标还捕捉到了发展动力学,检测到了在 grokking 期间急剧的特征整合。令人惊讶的是,对抗训练可以在提高鲁棒性的同时增加有效特征,这与叠加态导致脆弱性的假设相矛盾。相反,该效应取决于任务复杂度与网络容量:具有充足容量的简单任务允许特征扩展(丰裕区),而复杂任务或有限容量则迫使特征减少(稀缺区)。通过将叠加态定义为有损压缩,本研究实现了对神经网络在计算约束下如何组织信息的有原则的衡量,将叠加态与对抗鲁棒性联系起来。

关键词

引用

@article{arxiv.2512.13568,
  title  = {Superposition as Lossy Compression: Measure with Sparse Autoencoders and Connect to Adversarial Vulnerability},
  author = {Leonard Bereska and Zoe Tzifa-Kratira and Reza Samavi and Efstratios Gavves},
  journal= {arXiv preprint arXiv:2512.13568},
  year   = {2025}
}

备注

Accepted to TMLR, view HTML here: https://leonardbereska.github.io/blog/2025/superposition/