中文

CHiLL:利用大语言模型从临床笔记中进行零样本可定制可解释特征提取

计算与语言 2023-10-23 v2 人工智能 机器学习

摘要

我们提出 CHiLL(Crafting High-Level Latents),一种用于线性模型特征自然语言规范的方法。CHiLL 以专家构建的查询提示 LLM,从健康记录中生成可解释特征。所得含噪标签随后用于训练简单线性分类器。基于向 LLM 的查询生成特征,可使医生利用其领域专长构建对下游感兴趣任务具临床意义的特征,而无需从原始 EHR 中手动提取。我们的动机来自真实世界风险预测任务,但作为可复现的替代,我们使用 MIMIC-III 与 MIMIC-CXR 数据及标准预测任务(如 30 天再入院)来评估该方法。我们发现,使用自动提取特征的线性模型与使用参考特征的模型性能相当,且比使用“词袋”特征的线性模型提供更强可解释性。我们验证了所学特征权重与临床预期吻合良好。

关键词

引用

@article{arxiv.2302.12343,
  title  = {CHiLL: Zero-shot Custom Interpretable Feature Extraction from Clinical Notes with Large Language Models},
  author = {Denis Jered McInerney and Geoffrey Young and Jan-Willem van de Meent and Byron C. Wallace},
  journal= {arXiv preprint arXiv:2302.12343},
  year   = {2023}
}

备注

To be published at EMNLP Findings 2023