中文

DiMEx:通过潜在扩散先验突破数据自由模型提取的冷启动问题

机器学习 2026-01-13 v2

摘要

模型窃取攻击构成机器学习即服务(MLaaS)的现存威胁,允许对手以极低的训练成本复制其专有模型。虽然数据自由模型提取(DFME)已成为一种隐蔽的攻击向量,但其仍受制于"冷启动"问题:基于GAN的对手在从随机噪声收敛到有意义数据方面会浪费数千个查询。我们提出了DiMEx框架,武装化预训练潜在扩散模型的丰富语义先验,以完全规避此初始化障碍。通过在生成器的潜在空间中采用随机嵌入贝叶斯优化(REMBO),DiMEx能够立即合成高保真查询,在仅2000个查询即可实现52.1%的SVHN一致性——以碳基GAN基线超出16个百分点。为对抗这一高度语义化威胁,我们引入了混合有状态集合(Hybrid Stateful Ensemble, HSE)防御措施,识别潜在空间攻击的独特"优化轨迹"。我们的结果表明,尽管DiMEx能规避静态分布检测器,HSE却利用这一时序特征将攻击成功率压制至21.6%,并几乎不增加延迟。

关键词

引用

@article{arxiv.2601.01688,
  title  = {DiMEx: Breaking the Cold Start Barrier in Data-Free Model Extraction via Latent Diffusion Priors},
  author = {Yash Thesia and Meera Suthar},
  journal= {arXiv preprint arXiv:2601.01688},
  year   = {2026}
}

备注

8 pages, 3 figures, 4 tables