中文

当原始数据占据上风:大语言模型嵌入在医学机器学习中的数值数据表示有效性

计算与语言 2024-09-23 v2 人工智能 机器学习

摘要

大语言模型(LLM)的引入推动了数据表示和分析方面的进展,为其在医学问答领域带来了显著进步。尽管如此,将表格数据,特别是临床背景下至关重要的数值数据集成到LLM范式中尚未得到充分探索。本研究我们检查了来自大语言模型最后隐藏状态的向量表示在电子健康记录(EHR)数据上的医学诊断和预后应用的有效性。我们将这些嵌入与用于医学机器学习任务的原始数值EHR数据进行比较,后者是使用在表格数据学习方面表现突出的传统机器学习(ML)算法(如极端梯度提升)作为特征输入。我们聚焦于在零样本设置下使用指令调校型LLM来表示异常生理数据,并评估它们作为特征提取器来增强ML分类器用于预测诊断、住院天数和死亡率的实用性。此外,我们还全面检验了在零样本和少样本LLM嵌入上进行提示工程技术的影响。尽管发现表明原始数据特征在医学机器学习任务中仍占上风,但零样本LLM嵌入显示出竞争性的结果,表明未来在医学应用中具有潜力的研究方向。

关键词

引用

@article{arxiv.2408.11854,
  title  = {When Raw Data Prevails: Are Large Language Model Embeddings Effective in Numerical Data Representation for Medical Machine Learning Applications?},
  author = {Yanjun Gao and Skatje Myers and Shan Chen and Dmitriy Dligach and Timothy A Miller and Danielle Bitterman and Matthew Churpek and Majid Afshar},
  journal= {arXiv preprint arXiv:2408.11854},
  year   = {2024}
}

备注

Accepted to Findings of EMNLP 2024