中文

从流形假设的视角看生成模型反演

机器学习 2025-09-25 v1

摘要

模型反演攻击(MIAs)旨在从训练好的模型中重建表示类的样本。最近的生成式 MIAs 利用生成对抗网络学习图像先验,以指导反演过程,产生的重建在视觉质量和与私人训练数据高度忠实度方面表现突出。为探索其有效性背后的原因,我们首先检查反演损失相对于合成输入的梯度,发现这些梯度 surprisingly noisy。进一步分析表明,生成式反演通过将梯度投影到生成器流形的切向空间来实现梯度去噪,过滤掉离流形的分量,同时保留与流形对齐的有信息方向。我们的实证测量显示,在标准监督训练的模型中,损失梯度往往显示出大angular deviation离数据流形,表明其与类相关方向的对齐较差。这一观察激励了我们的核心假设:当模型的损失梯度更贴近生成器流形时,模型对 MIAs 更脆弱。我们通过设计一种显式促进此类对齐的新训练目标来验证这一假设。基于这一洞察,我们进一步引入一种无训练的方法,以在反演期间增强梯度-流形对齐,实现了对最先进生成式 MIAs 的持续性改进。

关键词

引用

@article{arxiv.2509.20177,
  title  = {Generative Model Inversion Through the Lens of the Manifold Hypothesis},
  author = {Xiong Peng and Bo Han and Fengfei Yu and Tongliang Liu and Feng Liu and Mingyuan Zhou},
  journal= {arXiv preprint arXiv:2509.20177},
  year   = {2025}
}

备注

NeurIPS 2025