中文

LLM 微调 API 的点检测防御的根本局限

机器学习 2025-10-27 v2 密码学与安全

摘要

LLM 开发者对防止微调滥用攻击(即通过公共 API 进行微调以规避安全措施的攻击)实施了技术干预措施。先前的工作已针对特定微调 API 防御成功地发起了多次攻击。在本工作中,我们表明,旨在检测单个有害训练或推理样本('点检测')的防御措施在防止微调攻击方面存在根本性局限。我们构建了'不可探测的点攻击',该攻击利用良性模型输出(如语义或语法变体)中的熵来 covertly transmit 危险知识。我们的攻击仅由可收集于微调前模型的可疑怀疑的良性样本组成,这意味着训练和推理样本在单个层面上都是良性且低概率的。我们针对 OpenAI 微调 API 进行了测试,发现它们成功地引出了对有害多选问题的答案,并且它们通过我们设计的增强监控系统(该系统成功检测了其他微调攻击)进行了规避。我们鼓励社区开发针对我们所揭示的点微调 API 防御根本局限的防御措施。

关键词

引用

@article{arxiv.2502.14828,
  title  = {Fundamental Limitations in Pointwise Defences of LLM Finetuning APIs},
  author = {Xander Davies and Eric Winsor and Alexandra Souly and Tomek Korbak and Robert Kirk and Christian Schroeder de Witt and Yarin Gal},
  journal= {arXiv preprint arXiv:2502.14828},
  year   = {2025}
}