中文

构建希伯来语患者病程:用于临床时间线提取的语言模型

计算与语言 2025-12-15 v1

摘要

我们提出了一种新的希伯来语医学语言模型,旨在从电子健康记录中提取结构化的临床时间线,从而构建患者病程。我们的模型基于 DictaBERT 2.0,并在超过五百万份去标识化的医院记录上进行了持续预训练。为了评估其有效性,我们引入了两个新数据集——一个来自内科和急诊科,另一个来自肿瘤科——并标注了事件时间关系。我们的结果表明,我们的模型在两个数据集上均取得了优异的性能。我们还发现,词表适配提高了 token 效率,并且去标识化不会损害下游性能,这支持了注重隐私的模型开发。该模型已在伦理限制下供研究使用。

关键词

引用

@article{arxiv.2512.11502,
  title  = {Building Patient Journeys in Hebrew: A Language Model for Clinical Timeline Extraction},
  author = {Kai Golan Hashiloni and Brenda Kasabe Nokai and Michal Shevach and Esthy Shemesh and Ronit Bartin and Anna Bergrin and Liran Harel and Nachum Dershowitz and Liat Nadai Arad and Kfir Bar},
  journal= {arXiv preprint arXiv:2512.11502},
  year   = {2025}
}

备注

In Proceedings of the Workshop on Large Language Models and Generative AI for Health Informatics 2025, IJCAI 2025, Montreal, Canada