重新思考临床时间序列的分词策略:少即是多
机器学习
2025-12-08 v1
摘要
分词策略决定了模型如何处理电子健康记录,但对其有效性的公平比较仍然有限。我们对基于 transformer 架构的临床时间序列建模中的分词方法进行了系统性评估,揭示了关于时间特征和值特征重要性的任务依赖性和有时反直觉的发现。通过在 MIMIC-IV 上四个临床预测任务上的受控消融实验,我们证明显式时间编码对所评估的下游任务没有一致的统计显著性。值特征表现出任务依赖的重要性,影响死亡率预测但不影响再入院,表明代码序列本身可以携带足够的预测信号。我们进一步表明,冻结的预训练代码编码器在需要显著更少参数的情况下大幅优于其可训练对应物。更大的临床编码器在所有任务上提供一致的改进,受益于消除了计算开销的冻结嵌入。我们的受控评估实现了更公平的分词比较,并表明在许多情况下,更简单、参数高效的方法可以实现强劲性能,尽管最优分词策略仍然依赖于任务。
引用
@article{arxiv.2512.05217,
title = {Rethinking Tokenization for Clinical Time Series: When Less is More},
author = {Rafi Al Attrach and Rajna Fani and David Restrepo and Yugang Jia and Peter Schüffler},
journal= {arXiv preprint arXiv:2512.05217},
year = {2025}
}
备注
9 pages, 2 figures, 4 tables. Machine Learning for Health (ML4H) 2025, Findings track