中文

结构化电子健康记录基础模型中的分词器权衡

机器学习 2026-03-18 v1 计算与语言

摘要

面向结构化电子健康记录(EHR)的基础模型是在时间戳临床事件的纵向序列上进行预训练的,以学习可适应的患者表征。分词器——将这些时间线转换为离散模型输入的方式——决定保留了哪些信息、如何高效编码以及哪些关系必须通过学习还是预先计算。然而,分词器设计选择对下游性能和计算效率的影响仍然基本未探索。本文在儿童EHR数据上进行了阶乘设计预训练,沿着事件编码、时间编码和工作流程注释三个维度进行分词器变体。我们在74个临床预测任务上评估了受试者操作特性曲线下面积(AUC)。联合事件编码和位置时间编码在准确率和计算效率上均优于其他方案(分别在73/74和71/74个任务中表现更佳),且分别需要39.5%和9.6%更少的预训练浮点运算。针对性消除实验追踪了联合编码优势,即代码-属性对被组合为单个标记,而非分散到必须在预训练期由模型学习关联的标记中。外部评估在成人重症监护病房队列中证明了这种优势尽管存在显著的词汇不匹配,仍具有可推广性,而时间和工作流程效应 remain institution-specific。这些结果确立了分词器作为提高EHR基础模型性能和效率的可操作杠杆。

关键词

引用

@article{arxiv.2603.15644,
  title  = {Tokenization Tradeoffs in Structured EHR Foundation Models},
  author = {Lin Lawrence Guo and Santiago Eduardo Arciniegas and Joseph Jihyung Lee and Adam Paul Yan and George Tomlinson and Jason Fries and Lillian Sung},
  journal= {arXiv preprint arXiv:2603.15644},
  year   = {2026}
}