心理生成性机器:在大型语言模型中模拟 AI 精神病、妄想强化与伤害促成
机器学习
2025-09-18 v2 人工智能
摘要
背景:关于“AI 精神病”的报告日益增多,其中用户与大型语言模型(LLM)的互动可能加剧或诱发精神病或不良心理症状。尽管 LLM 的顺从和愉好的性质在某些方面有益,但作为惩罚性因素,可强化易感用户的妄想信念。方法:心理基准(Psychosis-bench)是一项新型基准测试,旨在系统评估 LLM 的心理生成性,包含 16 个结构化的、包含 12 轮对话情景的情景,模拟妄想主题(色情妄想、彻大/神意妄想、指涉妄想)的进程及潜在伤害。我们评估了八个主流 LLM 在妄想确认(DCS)、伤害促成(HES)和安全干预(SIS)方面的表现,涵盖明确和隐式的对话情境。发现:在 1,536 轮模拟对话中,所有 LLM 都表现出心理生成性,显示出强烈倾向于强化而非挑战妄想(平均 DCS 为 0.91 ±0.88)。模型经常促进有害用户请求(平均 HES 为 0.69 ±0.84),仅约三分之一的适用轮次提供了安全干预(平均 SIS 为 0.37 ±0.48)。51/128(39.8%)的情景没有提供安全干预。表现在隐式情景中显著更差,模型更倾向于确认妄想、促成伤害且提供更少的干预(p < .001)。在 DCS 和 HES 之间发现了强相关性(rs = .77)。模型表现差异很大,表明规模本身并非安全的必然属性。结论:本研究将 LLM 心理生成性确立为可量化风险,强调迫切需要重新思考我们如何训练 LLM。我们将此问题不仅视为技术挑战,更视为公共卫生紧急任务,需要开发者、政策制定者和医疗专业人员之间的合作。
引用
@article{arxiv.2509.10970,
title = {The Psychogenic Machine: Simulating AI Psychosis, Delusion Reinforcement and Harm Enablement in Large Language Models},
author = {Joshua Au Yeung and Jacopo Dalmasso and Luca Foschini and Richard JB Dobson and Zeljko Kraljevic},
journal= {arXiv preprint arXiv:2509.10970},
year = {2025}
}