视觉模型中对抗性成员操纵的统一视角
计算机视觉与模式识别
2026-04-06 v1
摘要
成员推断攻击旨在确定特定数据点是否属于模型的训练集,是评估视觉模型隐私泄露的有效工具。然而,现有的成员推断攻击隐式假设查询输入是诚实的,其对抗鲁棒性尚未被探索。我们表明,针对视觉模型的成员推断攻击暴露了一个先前被忽视的对抗面:对抗性成员操纵,其中难以察觉的扰动可以可靠地将非成员图像推入最先进成员推断攻击的“成员”区域。在本文中,我们通过分析其机制和影响,首次提供了关于这一现象的统一视角。我们首先证明,对抗性成员伪造在各种架构和数据集上始终有效。然后,我们揭示了一个独特的几何特征——一种特征性的梯度范数崩溃轨迹——尽管伪造成员与真实成员具有几乎相同的语义表示,但该轨迹能可靠地将两者区分开来。基于这一见解,我们引入了一种基于梯度几何信号的原理性检测策略,并开发了一个鲁棒推理框架,该框架能显著减轻对抗性操纵。大量实验表明,伪造是广泛有效的,而我们的检测和鲁棒推理策略显著增强了韧性。这项工作为视觉模型中的对抗性成员操纵建立了第一个全面的框架。
引用
@article{arxiv.2604.02780,
title = {A Unified Perspective on Adversarial Membership Manipulation in Vision Models},
author = {Ruize Gao and Kaiwen Zhou and Yongqiang Chen and Feng Liu},
journal= {arXiv preprint arXiv:2604.02780},
year = {2026}
}
备注
Accepted by CVPR 2026