大语言模型辅助儿科抑郁症筛查
机器学习
2025-01-30 v1 人工智能
计算与语言
摘要
传统的抑郁症筛查方法(如PHQ-9)在儿科初级保健中对儿童尤为困难,这主要是由于实际条件的限制。人工智能有望提供帮助,但心理健康领域标注数据集的稀缺,加上训练的计算成本,凸显了对高效、零样本方法的需求。本研究探讨了最先进的大语言模型(LLMs)在儿科环境(6-24岁)中提取抑郁症状的可行性。该方法旨在补充传统筛查并减少诊断错误。我们的研究结果表明,所有LLMs的效率比词匹配高60%,其中Flan在精确度方面领先(F1:0.65,精确率:0.78),在提取“睡眠问题”(F1:0.92)和“自我厌恶”(F1:0.8)等较罕见症状方面表现出色。Phi在精确率(0.44)和召回率(0.60)之间取得了平衡,在“感到抑郁”(0.69)和“体重变化”(0.78)等类别中表现良好。Llama 3的召回率最高(0.90),但会过度泛化症状,因此不太适合此类分析。面临的挑战包括临床记录的复杂性以及从PHQ-9评分中过度泛化的问题。LLMs面临的主要挑战包括处理包含患者不同时期临床信息的复杂临床记录结构,以及误解升高的PHQ-9评分。最后,我们证明了Flan提供的症状注释作为机器学习算法特征的有效性,该算法能以0.78的高精确率区分抑郁病例与对照组,与不使用这些特征的基线相比,性能显著提升。
关键词
引用
@article{arxiv.2501.17510,
title = {LLM Assistance for Pediatric Depression},
author = {Mariia Ignashina and Paulina Bondaronek and Dan Santel and John Pestian and Julia Ive},
journal= {arXiv preprint arXiv:2501.17510},
year = {2025}
}