中文

HoneypotNet:针对模型提取的后门攻击

密码学与安全 2025-01-03 v1 计算机视觉与模式识别

摘要

模型提取攻击是一类推理阶段的攻击,通过对模型发起一定数量的查询请求来逼近黑盒受害模型的功能和性能,然后利用模型的预测结果训练替代模型。这些攻击对生产模型和 MLaaS 平台构成严重的安全威胁,可能导致模型所有者获得显著的经济损失。已有工作提出了针对模型提取攻击的防御方法,包括修改模型输出或增加查询开销以避免提取的主动防御方法,以及检测恶意查询或利用水印进行事后验证的被动防御方法。本文引入一种新的防御范式,即以攻击为防御,修改模型的输出使其具有毒性,任何试图利用输出训练替代模型的恶意用户都将受到毒害。为此,我们提出一种新型轻量级后门攻击方法,称为 HoneypotNet,将受害模型的分类层替换为诱饥层,然后通过双层优化利用影子模型(以模拟模型提取)微调诱饥层,以实现既保持原有性能又使输出具有毒性。我们在四个常用基准数据集上经验性地证明,HoneypotNet 能够以高成功率将后门注入替代模型。注入的后门不仅促进所有权验证,还扰乱替代模型的功能,成为针对模型提取攻击的重要威慑。

关键词

引用

@article{arxiv.2501.01090,
  title  = {HoneypotNet: Backdoor Attacks Against Model Extraction},
  author = {Yixu Wang and Tianle Gu and Yan Teng and Yingchun Wang and Xingjun Ma},
  journal= {arXiv preprint arXiv:2501.01090},
  year   = {2025}
}

备注

Accepted to the AAAI 2025