中文

重新审视模型反演评估:从误导性标准到可靠的隐私评估

机器学习 2026-05-15 v7

摘要

模型反演攻击旨在通过利用对目标模型的访问,从私有训练数据中重建信息。几乎所有近期的模型反演研究都使用一个标准框架来评估攻击成功率,该框架通过一个在相同私有数据和任务设计上训练的次级评估模型来计算攻击准确率。在本文中,我们首次对这一主流评估框架进行了深入分析,并揭示了一个根本性问题:在现有框架下被认为成功的许多重建实际上是未能捕捉目标个体视觉身份的假阳性。我们首先证明这些模型反演假阳性满足与 I 型对抗样本相同的形式条件。通过受控实验,我们展示了极高的假阳性可迁移性,这是对抗行为的一个经验性特征,表明许多模型反演假阳性可能包含 I 型对抗特征。这种对抗可迁移性显著夸大了报告的攻击准确率,并导致现有模型反演工作中对隐私泄露的过度陈述。为了解决这个问题,作为我们的第二个贡献,我们引入了一个基于多模态大语言模型(MLLM)的新评估框架,其通用视觉推理避免了共享任务的脆弱性,并降低了当前评估框架的 I 型对抗可迁移性。我们提出了基于 MLLM 评估的系统设计原则。使用该框架,我们重新评估了跨不同数据集、目标模型和先验的 27 种模型反演攻击设置,并发现在传统方法下误报率始终很高。我们的结果呼吁重新评估模型反演研究的进展,并将基于 MLLM 的评估确立为评估机器学习系统隐私风险的更可靠标准。代码/数据/提示可在 https://hosytuyen.github.io/projects/FMLLM 获取。

关键词

引用

@article{arxiv.2505.03519,
  title  = {Revisiting Model Inversion Evaluation: From Misleading Standards to Reliable Privacy Assessment},
  author = {Sy-Tuyen Ho and Koh Jun Hao and Ngoc-Bao Nguyen and Alexander Binder and Ngai-Man Cheung},
  journal= {arXiv preprint arXiv:2505.03519},
  year   = {2026}
}

备注

Accepted to CVPR Findings 2026