面向未见类的成员推断攻击
机器人学
2025-06-10 v1
摘要
基于影子模型的成员推断攻击是当前最佳方法,这些模型模仿目标模型在所选非成员数据子集上的行为。然而,我们发现该类攻击因一个关键假设而根本受限——即影子模型能够复制在感兴趣分布上的目标模型行为。结果表明,在数据访问受限的关键 AI 安全应用中,因法律、伦理或程序因素限制,影子模型对查询示例毫无合理信号,从而导致基于影子模型的攻击 catastrophic 失败。尽管在影子模型范式下似乎难以解决,但我们发现分位回归攻击在这一情境下具有前景,因为这些模型学习的成员示例特征可泛化到未见类别。我们通过实证和理论分析证明,分位回归攻击在实际操作中实现的 TPR 高达影子模型方法的 11 倍,并提供一种理论模型,概述此方法成功所需的泛化属性。我们的工作识别了现有 MIA 中的重要失效模式,为旨在直接使用现有工具进行 AI 安全实际应用的实践者提供了警示。
引用
@article{arxiv.2506.06487,
title = {BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation},
author = {Zibo Zhou and Yue Hu and Lingkai Zhang and Zonglin Li and Siheng Chen},
journal= {arXiv preprint arXiv:2506.06487},
year = {2025}
}