Clinical ModernBERT:一种面向生物医学文本的高效长上下文编码器
计算与语言
2025-04-08 v1 人工智能
机器学习
摘要
我们提出了 Clinical ModernBERT,一种基于 Transformer 的编码器,在大规模生物医学文献、临床记录以及医学本体上进行预训练,融合了 PubMed 摘要、MIMIC IV 临床数据以及带有文本描述的医学编码。以 ModernBERT——当前最优的自然语言文本编码器——为基础,引入了旋转位置编码(RoPE)、Flash Attention 以及最长 8,192 tokens 的扩展上下文长度等架构升级,我们的模型将这些创新专门适配于生物医学与临床领域。Clinical ModernBERT 擅长为长上下文任务生成语义丰富的表征。我们既通过分析其预训练权重,也通过在一套全面的临床 NLP 基准上的实证评估,验证了这一点。
引用
@article{arxiv.2504.03964,
title = {Clinical ModernBERT: An efficient and long context encoder for biomedical text},
author = {Simon A. Lee and Anthony Wu and Jeffrey N. Chiang},
journal= {arXiv preprint arXiv:2504.03964},
year = {2025}
}
备注
Manuscript writeup corresponding to the Clinical ModernBERT pre-trained encoder (https://huggingface.co/Simonlee711/Clinical_ModernBERT)