利用 LLM 进行多语言临床实体链接至 ICD-10
计算与语言
2025-09-08 v1
摘要
临床实体链接是从临床文本中提取结构化信息的关键部分。它是将医学本体或分类中的代码分配给文本中短语的过程。国际疾病分类第十次修订版(ICD-10)是用于统计和保险目的的疾病分类国际标准。自动为出院小结中的术语分配正确的 ICD-10 代码将简化医疗专业人员的工作,并确保医院编码的一致性。我们的论文提出了一种利用大型语言模型将不同语言的临床术语链接到 ICD-10 代码的方法。该方法由一个多阶段流水线组成,利用临床词典匹配文本中明确的术语,然后应用 GPT-4.1 的上下文学习来预测与词典不匹配术语的 ICD-10 代码。我们的系统在不同语言的基准数据集上预测 ICD-10 代码方面显示出有希望的结果:在西班牙语 CodiEsp 数据集上,类别的 F1 值为 0.89,子类别的 F1 值为 0.78;在希腊语 ElCardioCC 数据集上,F1 值为 0.85。
引用
@article{arxiv.2509.04868,
title = {Using LLMs for Multilingual Clinical Entity Linking to ICD-10},
author = {Sylvia Vassileva and Ivan Koychev and Svetla Boytcheva},
journal= {arXiv preprint arXiv:2509.04868},
year = {2025}
}
备注
7 pages, 2 Figures, to be published in Proceedings of the 15th International Conference on Recent Advances in Natural Language Processing, RANLP 2025