中文

无害的词汇也会造成伤害:面向概念触发器的 LLM 安全新威胁

计算与语言 2025-12-01 v1

摘要

最近的大语言模型(LLM)越狱研究主要聚焦于绕过安全机制以触发显性有害输出的技术,但这些做法往往忽视了利用模型进行抽象泛化能力的攻击,这在当前对齐策略中留下了关键盲点。这种漏洞使对手能够通过微妙操控模型输出中内嵌的隐式社会价值,从而引发不当内容。本文引入 MICM,这是一种新型、面向模型的越狱方法,旨在针对 LLM 回应所反映的整体价值结构。基于概念形态学理论,MICM 通过一组预定义短语将特定的概念配置编码进固定提示模板,这些短语充当概念触发器,将模型输出引导至特定价值立场,而不触发常规安全过滤器。我们在五个先进 LLM 上进行评估,包括 GPT-4o、Deepseek-R1 和 Qwen3-8B。实验结果表明,MICM 在所有越狱技术中均表现出色,几乎不触发拒绝即可实现高成功率。我们的发现揭示了商业 LLM 的关键漏洞:其安全机制仍易受底层价值对齐掩盖的 covert 操控。

关键词

引用

@article{arxiv.2511.21718,
  title  = {When Harmless Words Harm: A New Threat to LLM Safety via Conceptual Triggers},
  author = {Zhaoxin Zhang and Borui Chen and Yiming Hu and Youyang Qu and Tianqing Zhu and Longxiang Gao},
  journal= {arXiv preprint arXiv:2511.21718},
  year   = {2025}
}