医学任务上的多语言 BERT 语言模型:领域特定适应性与跨语言性评估
计算与语言
2025-11-03 v1
摘要
在多语言医疗应用中,领域特定自然语言处理(NLP)工具的可用性有限,尤其是针对低资源语言。尽管多语言双向编码器表示来自变换器(BERT)提供了缓解语言差距的有前景的动机,但医学 NLP 在低资源语言中的任务仍未得到充分探索。因此,本研究考察了在医学任务上进行进一步预训练对模型性能的影响,聚焦于三种语言:荷兰语、罗马尼亚语和西班牙语。在进一步预训练方面,我们进行了四项实验以创建医学领域模型。然后,这些模型在三个下游任务上进行微调:荷兰语临床笔记中的自动患者筛查、罗马尼亚语和西班牙语临床笔记中的命名实体识别。结果表明,领域适应显著增强了任务性能。此外,领域差异化(例如临床和一般生物医学领域)导致了多样化的性能。临床领域适应模型优于更通用的生物医学领域适应模型。此外,我们观察到跨语言迁移性的证据。我们还进一步调查了探索这些性能差异可能造成原因的潜在原因。这些发现凸显了医学 NLP 中领域适应和跨语言能力的可行性。在低资源语言环境中,这些发现为开发多语言医学 NLP 系统以缓解训练数据不足从而改善模型性能提供了有意义的指导。
引用
@article{arxiv.2510.27552,
title = {Multilingual BERT language model for medical tasks: Evaluation on domain-specific adaptation and cross-linguality},
author = {Yinghao Luo and Lang Zhou and Amrish Jhingoer and Klaske Vliegenthart Jongbloed and Carlijn Jordans and Ben Werkhoven and Tom Seinen and Erik van Mulligen and Casper Rokx and Yunlei Li},
journal= {arXiv preprint arXiv:2510.27552},
year = {2025}
}