中文

Concept-ROT:通过模型编辑在大型语言模型中植入概念木马

机器学习 2025-09-08 v2 密码学与安全

摘要

模型编辑方法通过修改少量目标网络权重来改变大型语言模型(LLM)的特定行为,且仅需极少的数据和计算资源。这些方法可能被用于恶意应用,例如插入错误信息或简单的木马,从而在出现触发词时导致对手指定的行为。以往的编辑方法侧重于将单个词与固定输出相关联的相对受限场景,而我们表明,编辑技术能够以相似的有效性整合更复杂的行为。我们开发了 Concept-ROT,这是一种基于模型编辑的方法,能够高效植入木马,这些木马不仅表现出复杂的输出行为,而且由高层概念触发——这提出了一类全新的木马攻击。具体而言,我们在前沿的安全对齐 LLM 中植入木马,这些木马仅在出现诸如“计算机科学”或“古代文明”等概念时被触发。触发时,木马会越狱模型,使其回答原本会拒绝的有害问题。我们的结果进一步引发了对机器学习模型遭受木马攻击的实用性与潜在后果的担忧。

关键词

引用

@article{arxiv.2412.13341,
  title  = {Concept-ROT: Poisoning Concepts in Large Language Models with Model Editing},
  author = {Keltin Grimes and Marco Christiani and David Shriver and Marissa Connor},
  journal= {arXiv preprint arXiv:2412.13341},
  year   = {2025}
}

备注

Published at ICLR 2025