中文

MEDBERT.de:面向医学领域的综合性德语 BERT 模型

计算与语言 2024-05-17 v2 人工智能

摘要

本文提出 medBERTde,一个专为德语医学领域预训练的德国 BERT 模型。该模型在 470 万份德语医学文档的大型语料库上进行了训练,并在涵盖广泛学科与医学文档类型的八个不同医学基准上取得了新的 SOTA 性能。除评估模型整体性能外,本文还对其能力进行了更深入的分析。我们研究了数据去重对模型性能的影响,以及采用更高效分词方法的潜在益处。结果表明,诸如 medBERTde 这类领域特定模型对较长文本尤为有用,且训练数据的去重未必能带来性能提升。此外,我们发现高效分词在提升模型性能方面作用甚微,并将大部分性能提升归因于海量训练数据。为鼓励进一步研究,预训练模型权重及基于放射学数据的新基准已向公众开放,供科学界使用。

关键词

引用

@article{arxiv.2303.08179,
  title  = {MEDBERT.de: A Comprehensive German BERT Model for the Medical Domain},
  author = {Keno K. Bressem and Jens-Michalis Papaioannou and Paul Grundmann and Florian Borchert and Lisa C. Adams and Leonhard Liu and Felix Busch and Lina Xu and Jan P. Loyen and Stefan M. Niehues and Moritz Augustin and Lennart Grosser and Marcus R. Makowski and Hugo JWL. Aerts and Alexander Löser},
  journal= {arXiv preprint arXiv:2303.08179},
  year   = {2024}
}

备注

Keno K. Bressem and Jens-Michalis Papaioannou and Paul Grundmann contributed equally