中文

通过激活扰动探测神经网络:APEX

机器学习 2026-02-04 v1 人工智能

摘要

先前的神经网络探测工作主要依赖输入空间分析或参数扰动,这两种方法在访问中期表示中编码的结构信息方面面临根本性限制。我们提出了激活扰动用于探索(APEX)框架,通过扰动隐藏激活而保持输入和模型参数不变来进行推理。我们理论上表明,激活扰动通过抑制输入特定信号并放大表示层次结构,引发从样本依赖到模型依赖行为的原则性过渡,并进一步证明,输入扰动对应于该框架的一个受限特殊情况。通过代表性案例研究,我们展示了 APEX 的实际优势。在小噪声 regime 下,APEX 提供了一种轻量且高效的样本规律性度量,与既定指标一致,同时能够区分结构化模型与随机标记模型,并揭示语义连贯的预测转换。在大噪声 regime 下,APEX 揭示了由训练诱导的模型层面偏差,包括对目标类别预测高度集中的现象,这在后门模型中尤为突出。总体而言,我们的结果表明,APEX 提供了一种有效的视角,用于探索和理解神经网络,超越仅从输入空间可获得的范围。

关键词

引用

@article{arxiv.2602.03586,
  title  = {APEX: Probing Neural Networks via Activation Perturbation},
  author = {Tao Ren and Xiaoyu Luo and Qiongxiu Li},
  journal= {arXiv preprint arXiv:2602.03586},
  year   = {2026}
}