中文

大语言模型在青少年线上论坛中识别心理健康因素的表现

计算与语言 2024-04-29 v2

摘要

儿童和青少年的心理健康近年来持续恶化。最近的大语言模型 (LLM) 为通过成本和时间高效的方式监控和干预提供了很大希望,尽管针对学校欺凌和饮食失调等特定问题的研究尚未探讨 LLM 在该领域的性能或用于开放信息抽取(其中答案集合未预先确定)。我们创建一个新的 12-19 岁青少年在 Reddit 上的帖子数据集,由专家精神科医生标注以下类别:TRAUMA、PRECARITY、CONDITION、SYMPTOMS、SUICIDALITY 和 TREATMENT,并将专家标签与来自两款顶尖 LLM (GPT3.5 和 GPT4) 的注释进行比较。此外,我们创建了两个合成数据集以评估 LLM 在生成数据时进行注释的表现。我们发现 GPT4 与人类注释者之间的一致性相当,且在合成数据上的表现显著高于人类,但我们发现该模型仍偶尔会在否定和事实性问题上出错,而在合成数据上的更好表现是由于真实数据更复杂,而非固有的优势。

关键词

引用

@article{arxiv.2404.16461,
  title  = {Large Language Models Perform on Par with Experts Identifying Mental Health Factors in Adolescent Online Forums},
  author = {Isabelle Lorge and Dan W. Joyce and Andrey Kormilitzin},
  journal= {arXiv preprint arXiv:2404.16461},
  year   = {2024}
}