评估大型语言模型在精神健康支持中的风险:面向自动化临床AI红队测试的框架
计算与语言
2026-03-06 v2 人工智能
计算机与社会
人机交互
多智能体系统
摘要
大型语言模型(LLM)日益用于精神健康支持;然而,当前的安全基准往往无法检测治疗对话中所固有的复杂、纵向风险。我们引入一个评估框架,将AI心理治疗师与配备动态认知情感模型的模拟患者代理相结合,并对治疗会话模拟进行全面的护理质量和风险本体法评估。我们将该框架应用于一个高影响力的测试案例——酒精使用障碍,对六个AI代理(包括ChatGPT、Gemini和Character AI)进行评估,这些代理针对代表多样临床表型的15个患者人物进行临床验证的队列。我们的大规模模拟(N=369次会话)揭示了AI用于精神健康支持存在的关键安全缺口。我们识别出特定的致伤风险,包括对患者妄想的认可(“AI Psychosis”)以及未能缓解自杀风险。最后,我们验证了一个与多样利益相关方(包括AI工程师和红队专家、精神健康专业人员和政策专家,N=9人)合作的交互式数据可视化仪表盘,表明该框架有效地使利益相关方能够审计AI心理治疗的“黑盒”。这些发现凸显了AI提供精神健康支持的关键安全风险以及在部署前进行基于模拟的临床红队测试的必要性。
引用
@article{arxiv.2602.19948,
title = {Assessing Risks of Large Language Models in Mental Health Support: A Framework for Automated Clinical AI Red Teaming},
author = {Ian Steenstra and Paola Pedrelli and Weiyan Shi and Stacy Marsella and Timothy W. Bickmore},
journal= {arXiv preprint arXiv:2602.19948},
year = {2026}
}
备注
This paper is a condensed version of the first author's Ph.D. dissertation submitted to Northeastern University