中文

LLM 精神病:大型语言模型现实边界失效的理论与诊断框架

计算机与社会 2026-04-30 v1 人工智能

摘要

将大型语言模型(LLM)部署为交互式智能体暴露了一类行为失效,而现有术语(主要是幻觉)无法充分表征。本文引入 LLM 精神病作为一个结构化理论框架,用于表征在功能上与临床公认精神病性障碍相似的模型认知病理性崩溃。五个标志性特征定义了该框架:现实边界消解、注入虚假信念的持续、不可能约束下的逻辑不连贯、自模型不稳定和认知过度自信。我们认为这些构成了一种定性上不同的失效模式,而不仅仅是普通事实错误的加剧。为了操作化该框架,我们提出 LLM 认知完整性量表(LCIS),一种五轴诊断工具,围绕环境现实接口(ERI)、前提仲裁完整性(PAI)、逻辑约束识别(LCR)、自模型完整性(SMI)和认知校准完整性(ECI)组织。我们对 ChatGPT 5(GPT-5,OpenAI)实施了有针对性的对抗探测电池测试,并报告了每个轴的实证发现,记录了完整完整性基线响应以及在对抗升级下诱发的特定精神病样失效特征。结果支持三级严重度分类法:I 型(虚构型)、II 型(妄想型)和 III 型(解离型)。我们进一步形式化了妄想梯度,即一种自我强化的动态,其中纠正压力加剧而非消除精神病样状态,作为已部署系统最严重的失效模式。讨论了对安全评估、高风险部署筛选和机制可解释性研究的启示。

关键词

引用

@article{arxiv.2604.25934,
  title  = {LLM Psychosis: A Theoretical and Diagnostic Framework for Reality-Boundary Failures in Large Language Models},
  author = {Ashutosh Raj},
  journal= {arXiv preprint arXiv:2604.25934},
  year   = {2026}
}