中文

基于指定概率操控的白盒对抗攻击的 DNN 模型所有权验证

机器学习 2025-07-31 v3

摘要

本文提出了一种用于图像分类任务中深度神经网络(DNN)模型所有权验证的新框架。该框架允许合法所有者和第三方在不展示原始模型的情况下验证模型身份。我们假设一个灰盒场景:未经授权的用户拥有从原始模型非法复制的模型,在云环境中提供服务,用户发送图像并接收输出类别的概率分布作为分类结果。该框架对特定类别的输出概率应用白盒对抗攻击,将其对齐到指定值。由于对原始模型的了解,所有者能够生成此类对抗样本。我们提出了一种基于迭代快速梯度符号法(FGSM)的简单而有效的对抗攻击方法,并引入了控制参数。实验结果证实了利用对抗攻击识别 DNN 模型的有效性。

关键词

引用

@article{arxiv.2505.17579,
  title  = {Ownership Verification of DNN Models Using White-Box Adversarial Attacks with Specified Probability Manipulation},
  author = {Teruki Sano and Minoru Kuribayashi and Masao Sakai and Shuji Isobe and Eisuke Koizumi},
  journal= {arXiv preprint arXiv:2505.17579},
  year   = {2025}
}

备注

Accepted to EUSIPCO 2025