关于长临床文本知识的保持
计算与语言
2025-01-03 v2 人工智能
摘要
临床文本,如入院记录、出院小结与病程记录,包含丰富且有价值的信息,可用于临床决策。然而,使用 transformer 编码器处理临床文本的一个严重瓶颈来自这些模型的输入长度限制:基于 transformer 的编码器使用固定长度输入。因此,这些模型在处理医疗文本时会丢弃部分输入。若仅处理临床文本的一部分,存在丢失重要知识的风险。本文提出一种利用 transformer 编码器的聚合集成来在模型中保持长临床文本知识的新方法。先前研究单独使用集成或聚合,而我们研究了融合这些方法的效果。我们在两项临床结局任务上训练了若干预训练的 BERT 类 transformer 编码器:死亡预测与住院时长预测。我们的方法在长期临床记录预测任务上取得了优于所有基线模型的结果。我们在 MIMIC-III 临床数据库的入院记录上通过结合多个非结构化高维数据集进行了广泛实验,证明了我们方法的有效性与相对于现有方法的优越性。本研究表明,融合集成与聚合提升了临床预测任务尤其是死亡与住院时长的模型性能。
引用
@article{arxiv.2311.01571,
title = {On Preserving the Knowledge of Long Clinical Texts},
author = {Mohammad Junayed Hasan and Suhra Noor and Mohammad Ashrafuzzaman Khan},
journal= {arXiv preprint arXiv:2311.01571},
year = {2025}
}
备注
37 pages, 3 figures, 4 tables, 7 equations and 1 algorithm