中文

精神医学中下游LLM任务的可靠性审计:LLM生成的住院风险评分

机器学习 2026-04-30 v2 人工智能

摘要

大型语言模型(LLM)在临床推理和风险评估中日益受到利用,但其在精神医学等关键且不确定领域的解释性可靠性尚不清楚。先前的工作已识别了这些系统中的算法偏差和提示敏感性,引发了关于上下文信息如何影响模型输出的担忧,但尚无系统方法来评估这些因素,尤其是在精神医学领域。我们提出了一种围绕提示设计影响和医学无关输入包含对预测住院风险评分的影响来进行下游LLM任务可靠性审计。在我们的审计中,生成了n=50个合成患者轮廓,每个轮廓包含15个临床相关特征和最多50个临床无关特征,涵盖四种提示重新表述(中性、逻辑、人类影响、临床判断)。我们审计了四个LLM(Gemini 2.5 Flash、LLaMa 3.3 70b、Claude Sonnet 4.6、GPT-4o mini),我们的结果显示,包括医学无关变量导致所有模型和提示中预测住院风险的绝对平均值和输出变异性显著增加,表明随着上下文噪声的增加,预测稳定性降低。在许多模型-提示条件下,医学无关特征都对不稳定性产生了影响,提示变体独立地影响了不稳定性在模型依赖性方面的轨迹。这些发现量化了LLM基于精神医学风险评估对非临床信息的敏感性,凸显了在临床部署前需要进行此类系统评估的归因稳定性和不确定性行为的必要性。

关键词

引用

@article{arxiv.2604.22063,
  title  = {Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores},
  author = {Shevya Panda and Shinjini Bose and Ananya Joshi},
  journal= {arXiv preprint arXiv:2604.22063},
  year   = {2026}
}