计数方法仍然强大:在结构化EHR基准测试中对抗Transformer和LLM管道
人工智能
2025-11-04 v1
摘要
结构化电子健康记录(EHR)是临床预测的关键。尽管计数式学习器在此类数据上持续表现出色,但尚无基准测试直接将其与最新在各种NLP任务中显示优于单一LLM的混合代理LLM管道进行比较。本研究使用EHRSHOT数据集评估了八种方法的EHR预测:基于本体汇总构建的两种时间箱的计数式模型,基于LightGBM和Tabular基础模型TabPFN;预训练的顺序Transformer(CLMBR);以及将表格历史转换为自然语言摘要后使用文本分类器的混合代理管道。我们使用EHRSHOT数据集评估了八个结果。在八个评估任务中,计数式方法与混合代理方法之间的头盾性胜出 largely split。鉴于其简单性和可解释性,计数式模型仍是结构化EHR基准测试的强有力候选。源代码可在 https://github.com/cristea-lab/Structured_EHR_Benchmark 查阅。
引用
@article{arxiv.2511.00782,
title = {Count-Based Approaches Remain Strong: A Benchmark Against Transformer and LLM Pipelines on Structured EHR},
author = {Jifan Gao and Michael Rosenthal and Brian Wolpin and Simona Cristea},
journal= {arXiv preprint arXiv:2511.00782},
year = {2025}
}