DALL-M:基于LLM的临床数据上下文感知数据增强
人工智能
2025-03-18 v3 信息检索
机器学习
摘要
X光图像在医学诊断中至关重要,但在缺乏临床背景信息时,其效用受限。放射科医生常发现胸部X光图像不足以诊断潜在疾病,因而需要将结构化临床特征与放射报告集成。为此,我们提出DALL-M,一种新型框架,通过生成情境性合成数据来增强临床数据集。DALL-M增强了结构化患者数据,包括生命体征(如心率、氧饱和度)、放射学发现(如病灶存在)以及人口统计因素。它将这些表格数据与从放射报告和领域特定资源(如Radiopaedia、Wikipedia)中提取的情境知识集成,确保临床一致性和可靠性。DALL-M遵循三个阶段的过程:(i) 临床情境存储,(ii) 专家查询生成,(iii) 情境感知特征增强。利用大型语言模型(LLM),它生成现有临床特征的情境性合成值以及全新的、临床上相关的特征。应用于来自MIMIC-IV数据集的799个案例,DALL-M将原始9个临床特征扩展到91个。与机器学习模型(包括决策树、随机森林、XGBoost和TabNET)的经验验证表明,DALL-M在F1分数上提高了16.5%,Precision和Recall分别提高了25%。DALL-M在保持数据完整性的同时增强了医疗诊断中预测建模的效果,为AI驱动的医疗诊断提供了可扩展且实用的方法。我们的结果表明,集成LLM生成的合成特征显著提升了模型性能,使DALL-M成为临床数据增强的关键方法。
引用
@article{arxiv.2407.08227,
title = {DALL-M: Context-Aware Clinical Data Augmentation with LLMs},
author = {Chihcheng Hsieh and Catarina Moreira and Isabel Blanco Nobre and Sandra Costa Sousa and Chun Ouyang and Margot Brereton and Joaquim Jorge and Jacinto C. Nascimento},
journal= {arXiv preprint arXiv:2407.08227},
year = {2025}
}