中文

大型语言模型在精神疾病诊断中的综合评估

人工智能 2025-11-25 v2

摘要

大型语言模型 (LLM) 在 various 领域展现出巨大潜力,包括 healthcare 领域,具有通过可扩展且可接近的解决方案变革mental health applications 的潜力。本研究旨在对33个LLM(参数规模从20亿到405+亿)进行全面评估,这些模型在六个数据集上使用社交媒体数据执行关键mental health tasks。迄今为止,这是对现代LLM用于mental health applications 中规模最大的系统评估。GPT-4、Llama 3、Claude、Gemma、Gemini和Phi-3等模型被评估其在zero-shot (ZS) 和few-shot (FS) 能力方面,涵盖三个任务:二元疾病检测、疾病严重程度评估和精神病学知识评估。关键发现表明,GPT-4和Llama 3等模型在二元疾病检测中表现优异,达到特定数据集上最高可达85%的准确率,而FS学习显著提升了疾病严重程度评估,将Phi-3-mini模型的平均绝对误差(MAE)降低1.3个点。最新模型如Llama 3.1 405b在精神病学知识评估方面表现卓越,达到91.2%的准确率,而提示工程在提升各任务性能方面发挥了关键作用。然而,许多LLM提供商实施的伦理约束限制了其回应敏感查询的能力,阻碍了进行全面性能评估。本工作揭示了LLM在mental health情境下的能力与局限,为未来在精神医学中的应用提供了宝贵见解。

关键词

引用

@article{arxiv.2409.15687,
  title  = {A Comprehensive Evaluation of Large Language Models on Mental Illnesses},
  author = {Abdelrahman Hanafi and Mohammed Saad and Noureldin Zahran and Radwa J. Hanafy and Mohammed E. Fouda},
  journal= {arXiv preprint arXiv:2409.15687},
  year   = {2025}
}