中文

EriBERTa:面向临床自然语言处理的双语预训练语言模型

计算与语言 2023-06-14 v1

摘要

将临床报告用于健康研究与治疗监测等多种二次用途,对提升患者照护至关重要。自然语言处理(NLP)工具已成为从此类报告中提取和处理相关信息的重要利器。然而,西班牙语临床领域专用语言模型的可用性一直有限。本文中,我们介绍EriBERTa,一种在大规模医学与临床语料上预训练的双语领域专用语言模型。我们证明EriBERTa在临床领域的西班牙语语言模型上表现更优,展现出其理解医学文本与提取有意义信息的卓越能力。此外,EriBERTa表现出良好的迁移学习能力,可实现从一种语言到另一种语言的知识迁移。鉴于西班牙语临床数据的匮乏,这一特性尤为有益。

关键词

引用

@article{arxiv.2306.07373,
  title  = {EriBERTa: A Bilingual Pre-Trained Language Model for Clinical Natural Language Processing},
  author = {Iker de la Iglesia and Aitziber Atutxa and Koldo Gojenola and Ander Barrena},
  journal= {arXiv preprint arXiv:2306.07373},
  year   = {2023}
}