中文

潜在空间隐藏的后门通道:现代神经网络的密码学不可检测性

密码学与安全 2026-05-14 v1 机器学习

摘要

最近的密码学结果表明,神经网络可被后门化,使得没有有效算法能够将其与干净模型区分开来。然而,这些保证仅限于结构受限、实践相关性有限的体系结构,留下了是否将类似的不可检测性扩展到现代、端到端训练的网络的开放问题。我们构建了一种针对最先进体系结构的攻击机制,紧密 aligned to 密码学概念的不可检测性,通过将后门通道识别为已学习的潜在方向,表明不可检测性问题可归约为两个对未知分布进行假设检验的测试,而我们推测这在实际中不可解。这种重新表述的后果显著:如果网络潜在空间中可被利用的通道在统计上不可被区分为自然学习的方向,那么攻击者无需引入外来结构,即可利用网络已具备的几何结构。我们在 ResNet 和 Vision Transformer 架构上进行了实验,分别在标准图像分类数据集上进行训练。该攻击实现了一致的高成功率,几乎不降低干净准确率,并且抵抗了全套事后防御措施,几乎没有任何防御能在不使模型不可用的情况下中和后门。我们的结果表明,密码学后门不必是需要特殊体系结构或人工构造的制件,但可以作为网络已学习表征几何结构内在属性的可识别特征。

关键词

引用

@article{arxiv.2605.13214,
  title  = {Backdoor Channels Hidden in Latent Space: Cryptographic Undetectability in Modern Neural Networks},
  author = {Marte Eggen and Eirik Reiestad and Kristian Gjøsteen and Inga Strümke},
  journal= {arXiv preprint arXiv:2605.13214},
  year   = {2026}
}