中文

超越上下文:大型语言模型理解用户意图的失败

人工智能 2026-04-28 v3 计算与语言 密码学与安全 计算机与社会

摘要

当前的大型语言模型(LLM)安全方法侧重于明确的有害内容,却忽略了一个关键的漏洞:无法理解上下文和识别用户意图。这产生了可利用的漏洞,恶意用户可以系统性地利用这些漏洞来绕过安全机制。我们实证评估了多个最先进的 LLM,包括 ChatGPT、Claude、Gemini 和 DeepSeek。我们的分析表明,通过情感框架、渐进式揭示和学术论证技术,可以绕过可靠的安全机制。值得注意的是,启用推理的配置放大了而非减轻了利用的有效性,在未能审视潜在意图的同时提高了事实精确度。唯一的例外是 Claude Opus 4.1,它在某些用例中将意图检测置于信息提供之上。这种模式揭示了当前的架构设计产生了系统性的漏洞。这些局限性要求范式转变,将上下文理解和意图识别作为核心安全能力,而非事后的保护机制。

关键词

引用

@article{arxiv.2512.21110,
  title  = {Beyond Context: Large Language Models' Failure to Grasp Users' Intent},
  author = {Ahmed M. Hussain and Salahuddin Salahuddin},
  journal= {arXiv preprint arXiv:2512.21110},
  year   = {2026}
}

备注

22 pages and 23 figures; updated authors list and revised manuscript