中文

吞下毒药丸:洞察大型语言模型间的漏洞不平等

密码学与安全 2025-02-27 v1 人工智能

摘要

现代大型语言模型(LLM)对毒药丸攻击表现出关键漏洞:即地点性数据毒化,以保持整体模型实用性的同时改变特定事实知识。我们系统性地展示了这些攻击利用 LLM 的内在架构特性,实现对长尾知识获取不准确率提高 54.6% 相对于主导话题,以及针对压缩模型相对于原始架构获取不准确率提高 25.5%。通过受控变异(如时间/空间/实体变更),我们的 метод 可导致局部记忆退化,对模型在常规标准基准(如 MMLU/GPQA 上性能下降 <2%)的表现几乎没有影响,从而可能规避检测。我们的发现表明:(1) 长尾知识的不成比例脆弱性可能源于参数冗余度的降低;(2) 模型压缩可能增加攻击面,被修剪/蒸馏模型仅需 30% 的毒药样本即可造成等效损害;(3) 关联记忆既可导致相关概念的牵连损伤扩散,亦可放大同时攻击的损伤,尤其针对主导话题。这些发现揭示了当前扩张范式的潜在问题,因为攻击成本降低而防御复杂度上升。我们的工作将毒药丸确立为安全威胁和诊断工具,揭示了语言模型压缩中的关键安全-效率权衡,挑战了 prevailing safety assumptions。

关键词

引用

@article{arxiv.2502.18518,
  title  = {Swallowing the Poison Pills: Insights from Vulnerability Disparity Among LLMs},
  author = {Peng Yifeng and Wu Zhizheng and Chen Chen},
  journal= {arXiv preprint arXiv:2502.18518},
  year   = {2025}
}