用于本地化医学 BERT 并增强生物医学 BERT 的预训练技术
计算与语言
2024-05-08 v3
摘要
在原始文本上预训练大规模神经语言模型为自然语言处理(NLP)中迁移学习的改进作出了重大贡献。随着基于 transformer 的语言模型(如 bidirectional encoder representations from transformers (BERT))的引入,NLP 从自由文本中抽取信息的能力在通用领域和医学领域均显著提升;然而,对于高质量且大规模公开数据库稀少的领域,难以训练表现良好的特定 BERT 模型。我们假设该问题可通过对领域特定语料上采样并以均衡方式与大语料一同用于预训练来解决。我们提出的方法包含单一干预及一个选项:上采样与扩增词表后的同步预训练。我们进行了三个实验并评估了所得产物。我们确认我们的日语医学 BERT 在医学文档分类任务上优于传统基线与其他 BERT 模型,且我们使用通用与医学领域语料预训练的英语 BERT 在生物医学语言理解评估(BLUE)基准上表现足以实用。此外,我们在预训练未使用临床笔记的增强生物医学 BERT 模型上,显示 BLUE 基准的临床与生物医学分数均比未用所提方法的消融模型高 0.3 分。通过上采样源自适于目标任务的语料的样本进行良好均衡的预训练,使我们能构建高性能 BERT 模型。
引用
@article{arxiv.2005.07202,
title = {Pre-training technique to localize medical BERT and enhance biomedical BERT},
author = {Shoya Wada and Toshihiro Takeda and Shiro Manabe and Shozo Konishi and Jun Kamohara and Yasushi Matsumura},
journal= {arXiv preprint arXiv:2005.07202},
year = {2024}
}
备注
We made the pre-trained weights of ouBioBERT and the source code for fine-tuning freely available at https://github.com/sy-wada/blue_benchmark_with_transformers