在安全网精神病医院使用预训练语言模型进行多标签分类的临床笔记自杀表型提取
计算与语言
2024-10-07 v2 人工智能
计算机与社会
信息检索
摘要
准确识别和分类自杀事件可以带来更好的自杀预防措施,减轻操作负担,并提高高敏锐度精神科环境中的护理质量。预训练语言模型有望从非结构化临床叙述中识别自杀倾向。我们评估了四种基于 BERT 的模型在使用两种微调策略(多个单标签和单个多标签)下,从 500 份带注释的精神科评估记录中检测共存自杀事件的性能。这些记录被标记为自杀意念 (SI)、自杀企图 (SA)、自杀暴露 (ES) 和非自杀性自伤 (NSSI)。RoBERTa 使用多个单标签分类策略的表现优于其他模型(acc=0.86,F1=0.78)。MentalBERT(acc=0.83,F1=0.74)也超过了 BioClinicalBERT(acc=0.82,F1=0.72),而后者又优于 BERT(acc=0.80,F1=0.70)。使用单个多标签分类微调的 RoBERTa 进一步提高了模型性能(acc=0.88,F1=0.81)。研究结果强调,模型优化、使用领域相关数据进行预训练以及单个多标签分类策略增强了自杀表型提取的模型性能。关键词:基于 EHR 的表型提取;自然语言处理;EHR 数据的二次利用;自杀分类;基于 BERT 的模型;精神病学;心理健康
引用
@article{arxiv.2409.18878,
title = {Suicide Phenotyping from Clinical Notes in Safety-Net Psychiatric Hospital Using Multi-Label Classification with Pre-Trained Language Models},
author = {Zehan Li and Yan Hu and Scott Lane and Salih Selek and Lokesh Shahani and Rodrigo Machado-Vieira and Jair Soares and Hua Xu and Hongfang Liu and Ming Huang},
journal= {arXiv preprint arXiv:2409.18878},
year = {2024}
}
备注
submitted to AMIA Informatics Summit 2025 as a conference paper