TreeText-CTS:用于不规则临床时间序列预测的紧凑、源可追溯树路径证据
机器学习
2026-05-21 v1
摘要
数值时间序列模型能够有效处理不规则电子健康记录(EHR)轨迹,但不自然地暴露支撑每个风险估计的测量值和时间模式的可读证据。现有基于文本的界面虽提升了可读性,却通常依赖原始序列化(冗长且冗余)或患者级别的自由形式摘要(难以追溯至源测量值和时间窗口)。为弥合此差距,我们引入了TreeText-CTS(Clinical Time-Series),其将不规则EHR轨迹转换为人类可读、紧凑且源可追溯的树路径证据单元,无需患者级别摘要或推理时自回归解码。TreeText-CTS将多尺度窗口摘要通过冻结的XGBoost模型路由,并将激活的树路径 verbalized为确定性、源可追溯的证据单元,由阈值条件构成。证据选择器汇聚一组信息丰富的证据单元,供语言模型编码器整合用于预测。在PhysioNet 2012死亡率、MIMIC-III死亡率和PhysioNet 2019败血症发生预测等数据集上,TreeText-CTS在评估的基于文本的EHR时间序列接口中实现了最佳AUROC和AUPRC,相较于最强的先前基于文本接口,AUPRC提升了6.0至9.7个绝对百分点,同时在与数值时间序列模型保持竞争力的同时表现优异。消融实验表明,树路径证据构建、证据选择和语言模型组合各自对性能都有贡献。由于传递给语言模型编码器的每个片段均由激活的树路径阈值条件构建而成,TreeText-CTS使最终预测器提供的证据可被检查且源可追溯。
引用
@article{arxiv.2605.20292,
title = {TreeText-CTS: Compact, Source-Traceable Tree-Path Evidence for Irregular Clinical Time-Series Prediction},
author = {Kwanhyung Lee and Juhwan Choi and Jongheon Kim and Joohyung Lee and Hyeongwon Jang and Eunho Yang},
journal= {arXiv preprint arXiv:2605.20292},
year = {2026}
}
备注
27 pages, 4 figures