使用大语言模型生成的合成数据检测难治性抑郁的临床特征
计算与语言
2024-02-13 v1
摘要
难治性抑郁 (DTD) 已提出作为一种更广泛且更全面的临床视角,旨在描述尽管接受治疗,个体仍持续承受显著负担的情绪障碍。我们旨在开发一种基于大语言模型 (LLM) 的工具,能够询问 routinely收集的叙述性 (非结构化) 电子健康记录 (EHR) 数据,以定位捕获 DTD 综合征的已发布预后因素。在本工作中,我们使用 LLM 生成的合成数据 (GPT3.5) 和非最大抑制 (NMS) 算法来训练基于 BERT 的标记提取模型。 resulting model 然后能够从真实临床数据中提取并标记与各种相关正面和负面因素相关的片段(即增加或减少患者符合 DTD 综合征概率的文本片段)。我们展示了在真实临床数据上以 0.70 的 F1 分数(跨极性)获得良好的总体性能,这些数据涉及最多 20 个不同因素;对于 DTD 的重要子集因素(如虐待史、家族情感障碍史、疾病严重程度和自杀倾向),在仅使用合成数据训练的情况下,模型表现出 0.85 的 F1 分数和 0.95 的精确度。我们的结果显示,在未来医疗应用中尤其是在通常需要高度保密医疗数据和人类专家标注的场景中,这种方法具有前景。
引用
@article{arxiv.2402.07645,
title = {Detecting the Clinical Features of Difficult-to-Treat Depression using Synthetic Data from Large Language Models},
author = {Isabelle Lorge and Dan W. Joyce and Niall Taylor and Alejo Nevado-Holgado and Andrea Cipriani and Andrey Kormilitzin},
journal= {arXiv preprint arXiv:2402.07645},
year = {2024}
}