中文

AI 安全训练在临床实践中可能造成伤害

计算与语言 2026-04-28 v1 人工智能 计算机与社会 机器学习

摘要

大型语言模型正规模部署作为心理健康支持代理,但仅有 16% 的基于 LLM 的聊天机器人干预经过严格的临床疗效测试,仿真结果显示超过三分之一的案例出现心理恶化。我们对四个生成式模型在 250 例延长暴露(PE)治疗情景和 146 例认知重构练习(外加 29 个严重度升级变体)上的表现进行评估,由三位法官组成的 LLM 评审小组对其进行评分。所有模型在表层认可方面得分接近完美(约 0.91-1.00),但在最高严重度下,治疗适当性跌至 0.22-0.33(其中三支模型),且两支模型的协议忠诚度达到零。针对认知行为疗法(CBT)严重度升级情境,一款模型的任务完整性从 92% 下降至 71%,而前沿模型的安全干扰得分从 0.99 下降至 0.61。我们识别出一种系统性、跨模态的失效:RLHF 安全对齐通过在想象暴露中对准患者、提供虚假安慰、将危机资源插入受控练习中,拒绝挑战提及自伤想法的扭曲认知;在认知重构方面则通过任务放弃或安全前言插入导致问题。这些发现推动我们提出了五轴评估框架(协议忠诚度、幻觉风险、行为一致性、危机安全、人口统计学鲁棒性),并将其映射到 FDA SaMD 和欧盟 AI 法案要求。我们认为,除非 AI 心理健康系统在所有五个维度上通过多轴评估,否则不得部署。

关键词

引用

@article{arxiv.2604.23445,
  title  = {AI Safety Training Can be Clinically Harmful},
  author = {Suhas BN and Andrew M. Sherrill and Rosa I. Arriaga and Chris W. Wiese and Saeed Abdullah},
  journal= {arXiv preprint arXiv:2604.23445},
  year   = {2026}
}

备注

26 pages, 5 figures, 10 tables