中文

CamemBERT-bio:利用持续预训练构建高性价比的法国生物医学数据模型

计算与语言 2024-04-04 v3 人工智能

摘要

医院中的临床数据通过临床数据仓库日益可获取用于研究。然而这些文档是非结构化的,因此有必要从医疗报告中提取信息以开展临床研究。使用类BERT模型(如CamemBERT)的迁移学习为法语带来了重大进展,尤其在命名实体识别方面。然而,这些模型针对普通语言训练,在生物医学数据上效率较低。为弥补此差距,我们引入了CamemBERT-bio,一个源自新公开法国生物医学数据集的专用法国生物医学模型。通过对原始CamemBERT的持续预训练,CamemBERT-bio在各种生物医学命名实体识别任务上平均实现了F1分数2.54点的提升,强化了持续预训练作为一种同样高效但计算密集度低于从头训练的替代方案的潜力。此外,我们强调了使用标准评估协议的重要性,该协议可清晰呈现法国生物医学模型当前的最先进水平。

关键词

引用

@article{arxiv.2306.15550,
  title  = {CamemBERT-bio: Leveraging Continual Pre-training for Cost-Effective Models on French Biomedical Data},
  author = {Rian Touchent and Laurent Romary and Eric de la Clergerie},
  journal= {arXiv preprint arXiv:2306.15550},
  year   = {2024}
}

备注

Accepted to LREC-COLING 2024