法语临床命名实体识别的基准评估
计算与语言
2024-04-01 v1 人工智能
定量方法
摘要
背景:基于 Transformer 的语言模型在许多自然语言处理(NLP)任务上表现出色。掩码语言模型(MLMs)受到持续关注,因为它们可以通过在特定语料库上训练或微调来适应不同的语言和子领域,同时比现代大语言模型(LLMs)更轻量。最近,针对法语生物医学领域发布了几个 MLMs,实验表明它们优于标准法语模型。然而,目前尚无在同一语料库上比较所有模型的系统评估。目的:本文针对法语生物医学掩码语言模型在临床命名实体识别任务上进行评估。材料与方法:我们评估了生物医学模型 CamemBERT-bio 和 DrBERT,并将它们与标准法语模型 CamemBERT、FlauBERT 和 FrALBERT 以及多语言 mBERT 进行比较,使用了三个公开可用的法语临床命名实体识别语料库。评估设置依赖于语料库开发者发布的金标准语料库。结果:结果表明 CamemBERT-bio 始终优于 DrBERT,FlauBERT 提供了具竞争力的性能,而 FrAlBERT 实现了最低的碳足迹。结论:这是首次针对法语临床实体识别的生物医学掩码语言模型基准评估,使用涵盖性能和环境影响的多项指标在嵌套实体识别上一致地比较了模型性能。
引用
@article{arxiv.2403.19726,
title = {A Benchmark Evaluation of Clinical Named Entity Recognition in French},
author = {Nesrine Bannour and Christophe Servan and Aurélie Névéol and Xavier Tannier},
journal= {arXiv preprint arXiv:2403.19726},
year = {2024}
}