中文

PsychBench:审计大型语言模型心理健康模拟中的流行病学忠实性

计算机与社会 2026-04-21 v1 人工智能

摘要

大型语言模型正在被部署用于临床培训、研究和心理健康工具的患者模拟,但人口层面的有效性尚未得到充分检验。我们引入 PsychBench,即对 LLM 患者模拟的首个流行病学审计:基于 NHANES 和 NESARC-III 基准,对来自四个前沿模型 (GPT-4o-mini、DeepSeek-V3、Gemini-3-Flash、GLM-4.7) 的 28,800 个轮廓进行评估,覆盖 120 个交叉性人群。核心发现是一致性-忠实性错位:模型产生临床上符合逻辑的个体,却未能代表其所来源的群体。方差压缩范围为 14% (GLM-4.7) 至 62% (DeepSeek-V3),消除了临床现实中分布尾部。尽管测试-重测相关性超过 r = 0.90,但 36.66% 的案例在不同运行之间跨越诊断阈值。症状相关矩阵在不同人口统计学群体间的差异超过二分半噪声,跨性别人群的差异是种族差异的 3-5 倍。校准偏差是系统性且非对称的。模型对大多数群体的抑郁严重程度高估 3.6-6.1 分 (Cohen d = 1.13-1.91),符合在临床语料中基线率偏高的训练特征。对于跨性别女性,方向相反:模型仅捕获 8-46% 的已记录的少数派压力提升,残差为 -5.42 (d = -1.55)。模型还会将不安归因于 Black 男性,将疲劳归因于女性,超出匹配对照。这些模式在美国和中国架构中复制,表明与当前训练范式相关的失败,而非孤立实现。对于大多数用户,LLM 心理健康工具风险将普通痛苦病理化;对于跨性别用户,算法会消除真实需求。患者看起来正确。它们不代表真实人群。

关键词

引用

@article{arxiv.2604.17359,
  title  = {PsychBench: Auditing Epidemiological Fidelity in Large Language Model Mental Health Simulations},
  author = {Patrick Keough},
  journal= {arXiv preprint arXiv:2604.17359},
  year   = {2026}
}

备注

18 pages, 8 figures