MediTab:通过数据整合、增强与精炼扩展医疗表格数据预测器
机器学习
2024-05-02 v4 人工智能
摘要
表格数据预测已应用于患者健康风险预测等医疗场景。然而,现有方法通常围绕算法设计,而忽视数据工程的重要性。医疗表格数据集在不同来源间常表现出显著异质性,且每源样本量有限。因此,先前的预测器常在人工整理的小数据集上训练,难以在推断时跨不同表格数据集泛化。本文提出将医疗表格数据预测器(MediTab)扩展至具有不同特征的各种表格输入。该方法使用数据引擎,借助大语言模型(LLMs)整合表格样本以克服跨不同模式(schema)表格的障碍。其还利用“学习、标注与精炼”流水线将域外数据与目标任务对齐。扩充后的训练数据使预训练的 MediTab 无需微调即可推断该领域内任意表格输入,相较有监督基线取得显著提升:其在 7 个患者结局预测数据集与 3 个试验结局预测数据集上分别达到 1.57 与 1.00 的平均排名。此外,MediTab 展现出令人印象深刻的零样本性能:在两个预测任务上分别平均超越有监督 XGBoost 模型 8.9% 与 17.2%。
引用
@article{arxiv.2305.12081,
title = {MediTab: Scaling Medical Tabular Data Predictors via Data Consolidation, Enrichment, and Refinement},
author = {Zifeng Wang and Chufan Gao and Cao Xiao and Jimeng Sun},
journal= {arXiv preprint arXiv:2305.12081},
year = {2024}
}
备注
IJCAI 2024