利用大型语言模型进行面向多语言的抑郁检测与严重程度评估
计算与语言
2025-04-08 v1 机器学习
摘要
抑郁是一种流行的精神健康障碍,由于主观症状评估,往往难以早期检测。近期的大型语言模型技术为实现客观化检测提供了高效且成本效益高的方案。本研究评估了四种大型语言模型在临床访谈数据上的抑郁检测性能。我们挑选表现最佳的模型,并进一步测试其在严重程度评估和知识增强情境下的表现。通过包含 51074 条来自六种不同精神障碍诊断数据集,我们评估了模型的鲁棒性。研究发现,DeepSeek V3 在零样本和少样本情境中均表现出色,尤其是零样本情境最为高效。严重程度评估结果显示,与人类评估者相比,尤其是轻度抑郁的检测一致性较低。模型在复杂诊断情境下保持稳定的高 AUC 值,能够有效检测抑郁症。这些发现凸显了 DeepSeek V3 在基于文本的临床抑郁检测中的强大潜力,但也强调了在严重程度评估和偏见缓解方面仍需进一步完善,以提升临床可靠性。
关键词
引用
@article{arxiv.2504.04891,
title = {Leveraging Large Language Models for Cost-Effective, Multilingual Depression Detection and Severity Assessment},
author = {Longdi Xian and Jianzhang Ni and Mingzhu Wang},
journal= {arXiv preprint arXiv:2504.04891},
year = {2025}
}