中文

PUREVQ-GAN:通过向量量化瓶颈防御数据投毒攻击

人工智能 2025-10-01 v1 计算机视觉与模式识别

摘要

我们引入了 PureVQ-GAN,一种针对数据投毒的防御方法,它利用带有 GAN 判别器的向量量化 VAE,通过离散瓶颈强制处理后门触发器。通过使用学习到的码本对投毒图像进行量化,PureVQ-GAN 在保留语义内容的同时破坏了细粒度的触发器模式。GAN 判别器确保输出匹配自然图像分布,防止重构出分布外扰动。在 CIFAR-10 上,PureVQ-GAN 对 Gradient Matching 和 Bullseye Polytope 攻击实现了 0% 的投毒成功率(PSR),对 Narcissus 攻击实现了 1.64% 的 PSR,同时保持 91-95% 的干净准确率。与需要数百次迭代细化步骤的基于扩散的防御不同,PureVQ-GAN 的速度快 50 倍以上,使其适用于真实的训练流程。

关键词

引用

@article{arxiv.2509.25792,
  title  = {PUREVQ-GAN: Defending Data Poisoning Attacks through Vector-Quantized Bottlenecks},
  author = {Alexander Branch and Omead Pooladzandi and Radin Khosraviani and Sunay Gajanan Bhat and Jeffrey Jiang and Gregory Pottie},
  journal= {arXiv preprint arXiv:2509.25792},
  year   = {2025}
}