中文

训练前表示:面向生成式医疗事件模型的固定预算基准

机器学习 2026-04-21 v1 人工智能

摘要

来自生成式医疗事件模型的每个预测都受制于临床事件如何被标记化,但输入表示往往被排除在其他系统和架构选择之外。我们评估表示决策如何影响共享一个-epoch预训练预算后的下游预测。我们在MIMIC-IV上训练28个匹配的变换器,并在三个实验中对其进行评估:(1) 量化粒度、参考范围锚定和代码值融合;(2) 值编码(硬箱、软离散、代码归一化xVal)与时间编码(事件顺序、时间标记、入院相对RoPE)的交叉实验;(3) 原生MIMIC实验室/生命体征代码与Common Longitudinal ICU Format(CLIF)重新映射后的实验室/生命体征代码,带有压缩保持扰动臂。在实验1中,融合代码值标记化使死亡率AUROC从0.891提高到0.915(BH调整p<0.001),住院长度-停留AUROC从0.763提高到0.788(BH调整p<0.001),并且对于融合与未融合的十分位比较,13个回归结果中的平均Spearman rho从0.414提高到0.494。在三个时间编码中,仅使用事件顺序和入院相对RoPE在平均水平上匹配或超过插入时间标记,同时将序列缩短11%。CLIF重新映射在我们的单中心设置中保留了下游性能,同时产生更小的、临床可解释的标记集,适用于多中心使用。在选择性结果中,细于十分位的量化、参考范围锚定和软离散有帮助,而代码归一化xVal在离散和软系列中表现显著低于后者,这与近似中位数抑制持续的现象相符。

关键词

引用

@article{arxiv.2604.16775,
  title  = {Representation Before Training: A Fixed-Budget Benchmark for Generative Medical Event Models},
  author = {Inhyeok Lee and Luke Solo and Michael C. Burkhart and Bashar Ramadan and William F. Parker and Brett K. Beaulieu-Jones},
  journal= {arXiv preprint arXiv:2604.16775},
  year   = {2026}
}

备注

39 pages. Submitted to Machine Learning for Healthcare 2026