中文

TabText:用于预测建模的表格健康数据基于语言的表示

机器学习 2025-09-30 v5

摘要

表格医疗记录仍是医疗领域应用机器学习最易获取的数据格式。然而,传统数据预处理忽略了表格中有价值的上下文信息,并需要大量人工清洗与协调,形成了模型开发的瓶颈。我们提出 TabText,一种利用上下文信息并简化表格医疗数据整理的预处理与特征提取方法。该方法将表格转换为上下文语言,并应用预训练大语言模型(LLMs)生成任务无关的数值表示。这些固定嵌入随后用作各类预测任务的输入。TabText 在美国医疗系统的六家医院电子病历上评估了九项住院流转预测任务(如 ICU 入院、出院、死亡率),并在 UCI 机器学习仓库的九个公开数据集上评估,涵盖癌症诊断、复发和生存等任务。使用单家医院未处理数据(572,964 患者日,2018年1月-2020年12月)训练的 TabText 模型,在 2021年1月-2022年4月 265,917 患者日的前瞻性测试中取得了准确性能(AUC 0.75-0.94),并良好泛化至五家未参与训练的其他医院。当用这些上下文嵌入增强预处理后的表格记录时,在 ICU 转院和乳腺癌复发等困难任务中,样本外 AUC 提升了最多 4 个附加百分点,而对已高性能任务几乎无增益。该发现在私有与公开数据集中均一致。

关键词

引用

@article{arxiv.2206.10381,
  title  = {TabText: Language-Based Representations of Tabular Health Data for Predictive Modelling},
  author = {Kimberly Villalobos Carballo and Liangyuan Na and Yu Ma and Léonard Boussioux and Cynthia Zeng and Luis R. Soenksen and Dimitris Bertsimas},
  journal= {arXiv preprint arXiv:2206.10381},
  year   = {2025}
}