中文

硬标签密码分析模型提取真的是多项式时间的吗?

机器学习 2026-03-30 v2 密码学与安全

摘要

深度神经网络(DNN)受到了广泛关注,其内部模型现在被视为有价值的知识资产。通过对 DNN 的预言机访问来提取此类模型,在概念上类似于从分组密码中提取密钥。因此,密码分析技术,特别是类差分攻击,已被积极探索。基于 ReLU 的 DNN 是最常见且部署最广泛的架构。虽然早期工作(如 Crypto 2020、Eurocrypt 2024)假设可以访问精确的输出 logits(通常不会暴露),但近期工作(如 Asiacrypt 2024、Eurocrypt 2025)聚焦于硬标签设置,其中仅可获得最终分类结果(例如"狗"或"汽车")。值得注意的是,Carlini 等人(Eurocrypt 2025)表明,即使在这种受限设置下,模型提取也可在多项式时间内完成。在本文中,我们表明其攻击所依赖的一个关键假设随着目标深度的增加而变得越来越不现实。虽然先前工作注意到某些神经元的激活状态很少变化,但我们分析了它们对硬标签提取的具体影响:即使单个神经元几乎始终处于活跃状态,也可能阻止攻击继续进行,除非其参数被恢复,而忽略它会产生不可忽略的错误。一个直接的解决方案是通过观察此类神经元的激活状态切换来提取其参数,但随着深度增加,观察此类切换变得指数级困难,这意味着硬标签提取并非总是多项式时间的。为解决这一局限性,我们提出了一种名为跨层提取的新攻击。与其直接提取秘密参数(如权重和偏置),我们利用跨层交互从更深层恢复它们,从而降低查询复杂度并解决现有方法的局限性。

关键词

引用

@article{arxiv.2510.06692,
  title  = {Is the Hard-Label Cryptanalytic Model Extraction Really Polynomial?},
  author = {Akira Ito and Takayuki Miura and Yosuke Todo},
  journal= {arXiv preprint arXiv:2510.06692},
  year   = {2026}
}

备注

Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract here is shorter than that in the PDF file