评估大语言模型在共病精神健康诊断中的表现
计算与语言
2024-10-08 v1 人工智能
摘要
本研究引入 ANGST,一个首个面向社交媒体帖子进行抑郁焦虑共病分类的基准数据集。不同于当代数据集常简化精神障碍之间复杂相互作用的做法(将其视为孤立条件),ANGST 启用多标签分类,允许每篇帖子同时被识别为抑郁和/或焦虑指征。ANGST 包含 2876 篇由专家心理学家精细标注的帖子,以及额外 7667 篇次级标注的帖子。 ANGST 使用各种最先进语言模型进行基准测试,从Mental-BERT到GPT-4。我们的结果为这些模型在复杂诊断情境中的能力与局限性提供了重要见解。虽然GPT-4总体上优于其他模型,但 none 在多类共病分类中达到 72% 以上的 F1 分数,这凸显了将语言模型应用于精神健康诊断的持续挑战。
引用
@article{arxiv.2410.03908,
title = {Still Not Quite There! Evaluating Large Language Models for Comorbid Mental Health Diagnosis},
author = {Amey Hengle and Atharva Kulkarni and Shantanu Patankar and Madhumitha Chandrasekaran and Sneha D'Silva and Jemima Jacob and Rashmi Gupta},
journal= {arXiv preprint arXiv:2410.03908},
year = {2024}
}
备注
24 Pages