DrBenchmark:法语生物医学领域的大语言理解评估基准
计算与语言
2024-06-11 v1 人工智能
机器学习
摘要
生物医学领域引发了自然语言处理 (NLP) 领域的极大兴趣,该领域随着预训练语言模型 (PLMs) 的出现取得了重大进展。然而,由于不同模型的评估协议存在差异,比较这些模型已被证明具有挑战性。一个公平的解决方案是将多样化的下游任务聚合为一个基准,从而从各个角度评估 PLM 的内在质量。尽管这一举措已在生物医学领域开展,但仍局限于少数语言, notably 英语和中文。这种局限性阻碍了对最新法语生物医学模型的评估,因为它们要么在少量任务上使用非标准化协议进行评估,要么使用通用下游任务进行评估。为了弥补这一研究差距并考虑到法语的独特敏感性,我们推出了首个公开可用的法语生物医学语言理解基准 DrBenchmark。它包含 20 个多样化任务,包括命名实体识别、词性标注、问答、语义文本相似度和分类。我们在通用数据和生物医学特定数据上评估了 8 个最先进的预训练掩码语言模型 (MLMs),并评估了英语特定 MLMs 以考察其跨语言能力。我们的实验表明,没有单一模型在所有任务中都表现出色,而通用模型有时仍具有竞争力。
引用
@article{arxiv.2402.13432,
title = {DrBenchmark: A Large Language Understanding Evaluation Benchmark for French Biomedical Domain},
author = {Yanis Labrak and Adrien Bazoge and Oumaima El Khettari and Mickael Rouvier and Pacome Constant dit Beaufils and Natalia Grabar and Beatrice Daille and Solen Quiniou and Emmanuel Morin and Pierre-Antoine Gourraud and Richard Dufour},
journal= {arXiv preprint arXiv:2402.13432},
year = {2024}
}
备注
Accepted at LREC-Coling 2024