医疗保健中生成式 AI 模型的多标签分类:自杀倾向与风险因素案例研究
计算与语言
2025-07-24 v1 信息检索
定量方法
摘要
自杀仍然是一个紧迫的全球健康危机,每年导致超过 72 万人死亡,数百万人受到自杀意念(SI)和自杀未遂(SA)的影响。早期识别自杀倾向相关因素,包括 SI、SA、自杀暴露(ES)和非自杀性自伤(NSSI),对于及时干预至关重要。虽然先前的研究已将 AI 应用于检测临床记录中的 SrFs,但大多数研究将自杀倾向视为二元分类任务,忽视了共病风险因素的复杂性。本研究探讨了生成式大语言模型,特别是 GPT-3.5 和 GPT-4.5,在从精神科电子健康记录中对 SrFs 进行多标签分类(MLC)的应用。我们提出了一种新颖的端到端生成式 MLC 流水线,并引入了先进的评估方法,包括标签集级别指标和多标签混淆矩阵用于错误分析。微调后的 GPT-3.5 取得了最佳性能,部分匹配准确率为 0.94,F1 分数为 0.91,而带有引导提示的 GPT-4.5 在各个标签集(包括罕见或少数标签集)上表现出更优的性能,表明其具有更均衡和稳健的表现。我们的研究结果揭示了系统性的错误模式,例如 SI 和 SA 的混淆,并突出了模型倾向于谨慎过度标注的特点。这项工作不仅证明了使用生成式 AI 进行复杂临床分类任务的可行性,还为构建非结构化 EHR 数据以支持大规模临床研究和循证医学提供了蓝图。
引用
@article{arxiv.2507.17009,
title = {Multi-Label Classification with Generative AI Models in Healthcare: A Case Study of Suicidality and Risk Factors},
author = {Ming Huang and Zehan Li and Yan Hu and Wanjing Wang and Andrew Wen and Scott Lane and Salih Selek and Lokesh Shahani and Rodrigo Machado-Vieira and Jair Soares and Hua Xu and Hongfang Liu},
journal= {arXiv preprint arXiv:2507.17009},
year = {2025}
}