边界框水印:防御针对目标检测器的模型提取攻击
密码学与安全
2025-06-26 v2 计算机视觉与模式识别
摘要
部署在云端的深度神经网络(DNN)通常允许用户通过 API 查询模型。然而,这些 API 使模型面临模型提取攻击(MEAs)。在此类攻击中,攻击者试图通过滥用 API 的响应来复制目标模型。基于后门的 DNN 水印技术被认为是一种很有前景的防御 MEAs 的方法,其中防御者通过 API 响应将后门注入到被提取的模型中。该后门被用作模型的数字水印;如果某个可疑模型具有该水印(即后门),则被验证为提取的模型。本研究聚焦于目标检测(OD)模型。现有的针对 OD 模型的后门攻击作为在现实威胁模型下防御 MEAs 的手段,并不适用于模型水印。我们提出的方法通过在保持 OD 能力的同时,隐蔽地修改查询中检测到的对象的边界框,经由 API 将后门注入到提取的模型中。在三个 OD 数据集上的实验中,所提出的方法在广泛的实验场景下均以 100% 的准确率成功识别出了被提取的模型。
引用
@article{arxiv.2411.13047,
title = {Bounding-box Watermarking: Defense against Model Extraction Attacks on Object Detectors},
author = {Satoru Koda and Ikuya Morikawa},
journal= {arXiv preprint arXiv:2411.13047},
year = {2025}
}
备注
Accepted at ECML-PKDD2025. Please refer to the conference proceedings for the final version. Source codes: https://zenodo.org/records/15641464