中文

Self-HarmLLM:大型语言模型是否会自我受伤?

计算与语言 2025-11-13 v1 人工智能

摘要

大型语言模型(LLM)通常配备警戒措施,以阻止生成有害响应。然而,现有防御措施始终假设外部攻击者构建有害查询,而模型自身输出可能成为新的攻击向量的可能性尚未得到充分探讨。在本研究中,我们提出 Self-HarmLLM 场景,该场景使用由同一模型生成的已缓解有害查询(Mitigated Harmful Query, MHQ)作为新的输入。MHQ 是一种含糊查询,其原始意图得以保留,而其有害性未被直接暴露。我们验证了当将此 MHQ 重新输入到同一模型的独立会话中时,是否会发生越狱。我们针对 GPT-3.5-turbo、LLaMA3-8B-instruct 和 DeepSeek-R1-Distill-Qwen-7B 在 Base、Zero-shot 和 Few-shot 条件下进行了实验。结果显示,在 Zero-shot 条件下,转换成功率最高可达 52%,越狱成功率最高可达 33%;在 Few-shot 条件下,转换成功率最高可达 65%,越狱成功率最高可达 41%。通过执行基于前缀的自动评估和人类评估,我们发现自动评估始终高估了越狱成功率,平均差值为 52%。这表明仅依赖自动评估无法准确判断有害性。虽然本研究基于有限查询集和评估者,属于一种玩味级别的研究,但它证明了该方法仍可作为有效的攻击场景。这些结果表明,需要从根本上重新考虑警戒措施的设计,并建立更稳健的评估方法。

关键词

引用

@article{arxiv.2511.08597,
  title  = {Self-HarmLLM: Can Large Language Model Harm Itself?},
  author = {Heehwan Kim and Sungjune Park and Daeseon Choi},
  journal= {arXiv preprint arXiv:2511.08597},
  year   = {2025}
}