隐藏于平面内:用于审计会员推断的干净标签后门
密码学与安全
2024-11-28 v1 人工智能
机器学习
摘要
会员推断攻击(MIAs)是评估隐私风险和确保遵循《通用数据保护条例》(GDPR)等法规合规性的关键工具。然而,其用于审计未经授权数据使用的潜力尚未得到充分探索。为弥合这一差距,我们提出一种新颖的干净标签后门方法,用于MIAs,专为稳健且隐形的数据审计而设计。不同于依赖可检测中毒样本(标签被改变)的传统方法,本方法保留自然标签,使其即使在低中毒率下仍具隐形性。本方法采用由影子模型生成的最优触发器,模拟目标模型的行为。该设计最小化触发样本与源类别在特征空间中的距离,同时保留原始数据标签。结果是一个强大且不可检测的审计机制,克服了现有方法的局限性,如标签不一致和受控样本中的视觉瑕疵。该方法通过黑盒访问实现稳健的数据审计,在多样化的数据集和模型架构上实现高攻击成功率。此外,它解决了触发器隐形性和中毒持久性相关的挑战,确立了一种实用且有效的数据审计解决方案。全面的实验验证了我们方法的有效性和通用性,在隐身性和攻击成功率等指标上均优于多个基线方法。
引用
@article{arxiv.2411.16763,
title = {Hide in Plain Sight: Clean-Label Backdoor for Auditing Membership Inference},
author = {Depeng Chen and Hao Chen and Hulin Jin and Jie Cui and Hong Zhong},
journal= {arXiv preprint arXiv:2411.16763},
year = {2024}
}