语言模型中从注入到蒸馏的级联对抗偏差
机器学习
2025-10-17 v2 密码学与安全
摘要
模型蒸馏已成为创建保留大型系统能力的更小、可部署语言模型的必要手段。然而,广泛的部署引发了对抵御对抗性操纵鲁棒性的担忧。本文研究了蒸馏模型在训练期间对抗性注入有偏差内容的脆弱性。我们证明,对手可以通过极小的数据投毒将微妙的偏差注入教师模型中,这些偏差会传播到学生模型并被显著放大。我们提出了两种传播模式:非目标传播,即偏差影响多个任务;以及目标传播,即专注于特定任务而在其他地方保持正常行为。仅需 25 个投毒样本(0.25% 投毒率),学生模型在目标场景中 76.9% 的时间会生成有偏差的响应——高于教师模型的 69.4%。对于非目标传播,在未见任务中,学生模型中对抗性偏差出现的频率高出 6 倍至 29 倍。我们在六种偏差类型(定向广告、网络钓鱼链接、叙事操纵、不安全编码实践)、各种蒸馏方法以及涵盖文本和代码生成的不同模态上验证了这些发现。我们的评估揭示了当前防御措施——困惑度过滤、偏差检测系统和基于 LLM 的自动评分框架——在应对这些攻击时的缺陷。结果暴露了蒸馏模型中存在的严重安全漏洞,凸显了对专门防护措施的需求。我们提出了构建有效对抗性偏差缓解策略的实用设计原则。
引用
@article{arxiv.2505.24842,
title = {Cascading Adversarial Bias from Injection to Distillation in Language Models},
author = {Harsh Chaudhari and Jamie Hayes and Matthew Jagielski and Ilia Shumailov and Milad Nasr and Alina Oprea},
journal= {arXiv preprint arXiv:2505.24842},
year = {2025}
}