ZIUM:针对未退学模型的零样本意图感知对抗攻击
计算机视觉与模式识别
2025-07-30 v1 密码学与安全
摘要
机器退学(MU)旨在从深度学习模型中移除特定数据点或概念,以提升隐私并防止敏感内容生成。对抗性提示可被用于利用未退学模型生成包含被移除概念的内容,构成重大安全风险。然而,现有对抗攻击方法仍面临生成内容符合攻击意图意义下难题,以及识别成功提示高计算成本挑战。为此,我们提出 ZIUM,一种面向未退学模型的零样本意图感知对抗攻击方法,实现对目标攻击图像的灵活定制以反映攻击者意图。此外,ZIUM 支持无需针对先前攻击的未退学概念进行额外优化的零样本对抗攻击。对各种MU情境的评估表明,ZIUM 在用户意图提示下成功定制内容的能力突出,攻击成功率优于现有方法。更重要的是,其零样本对抗攻击显著降低了先前攻击未退学概念的攻击时间。
引用
@article{arxiv.2507.21985,
title = {ZIUM: Zero-Shot Intent-Aware Adversarial Attack on Unlearned Models},
author = {Hyun Jun Yook and Ga San Jhun and Jae Hyun Cho and Min Jeon and Donghyun Kim and Tae Hyung Kim and Youn Kyu Lee},
journal= {arXiv preprint arXiv:2507.21985},
year = {2025}
}
备注
Accepted to ICCV2025