从 token 到 token 对:面向临床预测的大语言模型高效提示压缩
计算与语言
2026-05-13 v1 机器学习
摘要
通过将电子健康记录 (EHR) 作为自然语言序列处理,大语言模型 (LLM) 在死亡预测和表型标记等临床预测任务中显示出潜力。然而,纵向或高频 EHR 常常产生过长的 token 序列,导致高计算成本甚至降低性能。现有解决方案要么添加压缩模块,要么删除不重要的 token,这会引入额外的推理延迟或风险丢失临床信息。为实现 token 序列的无损压缩,同时无需额外成本或性能下降,我们提出 Medical Token-Pair Encoding (MedTPE),这是一种分层方法,扩展了标准的 EHR 序列分词方式。MedTPE 将频繁共现的医疗 token 对合并为复合 token,实现无损压缩,同时通过依赖感知的替换策略保持计算复杂度。仅对新引入的 token(仅占 LLM 参数的 0.5-1.0%)进行自监督学习微调。针对两个临床场景在真实数据集上的实验表明,MedTPE 将输入 token 长度缩短最高 31%,推理延迟降低 34-63%,同时在多个 LLM 和四个临床预测任务中保持或甚至提高预测性能和输出格式合规性。此外,MedTPE 在不同输入上下文长度下表现出鲁棒性,并 demonstrated generalizability to scientific and financial domains and different languages.
引用
@article{arxiv.2605.11774,
title = {From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction},
author = {Mingcheng Zhu and Zhiyao Luo and Yu Liu and Tingting Zhu},
journal= {arXiv preprint arXiv:2605.11774},
year = {2026}
}
备注
21 pages, 6 figures, 13 tables