中文

数据投毒攻击的可证明水印

密码学与安全 2025-10-13 v1 机器学习

摘要

近年来,数据投毒攻击越来越被设计为看似无害甚至有益,往往旨在验证数据集的所有权或保护私人数据免受未经授权的使用。然而,这些发展可能引起误解和冲突,因为数据投毒传统上被视为对机器学习系统的安全威胁。为解决此问题,无害投毒生成器必须声称其生成的数据集的所有权,使使用者能够识别潜在的投毒以防止滥用。本文提出将水印方案作为解决此挑战的方法。我们引入两种可证明且实际的水印方法用于数据投毒:post-poisoning水印和poisoning-concurrent水印。我们的分析表明,当水印长度为 Θ(d/ϵw)\Theta(\sqrt{d}/\epsilon_w) 时,post-poisoning水印;而poisoning-concurrent水印长度落在 Θ(1/ϵw2)\Theta(1/\epsilon_w^2)O(d/ϵp)O(\sqrt{d}/\epsilon_p) 范围内,可证明地确保水印可检测性和投毒实用性,证明了在数据投毒攻击下水印的实际性。我们通过在几组攻击、模型和数据集上的实验验证了理论发现。

关键词

引用

@article{arxiv.2510.09210,
  title  = {Provable Watermarking for Data Poisoning Attacks},
  author = {Yifan Zhu and Lijia Yu and Xiao-Shan Gao},
  journal= {arXiv preprint arXiv:2510.09210},
  year   = {2025}
}

备注

42 pages, NeurIPS 2025