面向临床表型识别的跨语言知识迁移
计算与语言
2022-08-04 v1
摘要
临床表型识别能够自动从病历中提取临床状况,这有益于全球的医生与诊所。然而,当前最先进的模型大多仅适用于英文书写的临床记录。因此,我们研究跨语言知识迁移策略,以在不使用英文且仅有少量领域内数据的诊所中执行该任务。我们利用来自心脏病学、肿瘤学和重症监护室(ICU)等不同临床领域的临床记录,针对一家希腊诊所和一家西班牙诊所评估这些策略。我们的结果揭示了两种优于最先进方法的策略:基于翻译的方法结合领域特定编码器,以及跨语言编码器加适配器。我们发现这些策略在分类罕见表型时表现尤为出色,并就何种情况下优先选用何种方法给出建议。我们的结果表明,使用多语言数据总体上可改进临床表型识别模型,并能弥补数据稀疏性。
引用
@article{arxiv.2208.01912,
title = {Cross-Lingual Knowledge Transfer for Clinical Phenotyping},
author = {Jens-Michalis Papaioannou and Paul Grundmann and Betty van Aken and Athanasios Samaras and Ilias Kyparissidis and George Giannakoulas and Felix Gers and Alexander Löser},
journal= {arXiv preprint arXiv:2208.01912},
year = {2022}
}
备注
LREC 2022 submmision: January 2022