中文

BioClinical ModernBERT:面向医学和临床 NLP 的 SOTA 长上下文编码器

计算机视觉与模式识别 2025-06-13 v1 人工智能

摘要

基于编码器的变换模型是医学和临床自然语言处理(NLP)的核心,因为其双向自注意力机制使其适合通过判别任务高效地从非结构化文本中提取结构化信息。然而,编码器的发展速度较慢,导致在医学和临床领域的适应性有限。我们引入 BioClinical ModernBERT,这是一个针对医学和临床 NLP 进行领域适应的编码器,基于最近的 ModernBERT 发行版发展,集成长上下文处理和在医学和临床 NLP 中的显著性能提升。BioClinical ModernBERT 通过在目前最大的医学和临床语料库上继续预训练(超过 535 亿 token),并通过利用来自不同机构、不同领域和不同地区的 20 个数据集来克服以往临床编码器依赖单一数据源的局限。它在涵盖广泛用例的四个下游任务上超越了现有的医学和临床编码器。我们发布了 base(1.5 亿参数)和 large(3.96 亿参数)两个版本的 BioClinical ModernBERT,以及训练检查点以支持进一步的研究。

关键词

引用

@article{arxiv.2506.10895,
  title  = {AIR: Zero-shot Generative Model Adaptation with Iterative Refinement},
  author = {Guimeng Liu and Milad Abdollahzadeh and Ngai-Man Cheung},
  journal= {arXiv preprint arXiv:2506.10895},
  year   = {2025}
}