中文

Win-k:面向小型语言模型的改进成员推断攻击

人工智能 2025-08-05 v1 密码学与安全

摘要

小型语言模型(SLMs)因其在资源受限环境中的效率和可部署性,日益受到青睐,适用于设备端、隐私敏感和边缘计算应用。相对于,成员推断攻击(MIAs)旨在判断给定样本是否用于模型训练,具有严重的隐私和知识产权影响。本文针对SLMs研究MIAs。尽管MIAs在大型语言模型(LLMs)上已显示有效,但在新兴的SLMs上研究相对不足,且随模型变小其有效性会降低。针对这一发现,我们提出一种新型MIAs,称为win-k,它基于最新攻击方法min-k构建。我们通过三个数据集和八个SLMs实验评估win-k,与五种现有MIAs进行比较。结果表明,win-k在AUROC、TPR @ 1% FPR和FPR @ 99% TPR等指标上优于现有方法,尤其在较小模型上效果更佳。

关键词

引用

@article{arxiv.2508.01268,
  title  = {Win-k: Improved Membership Inference Attacks on Small Language Models},
  author = {Roya Arkhmammadova and Hosein Madadi Tamar and M. Emre Gursoy},
  journal= {arXiv preprint arXiv:2508.01268},
  year   = {2025}
}