FRASIMED:通过基于跨语言 BERT 的标注投影生成的法语临床标注资源
计算与语言
2025-07-22 v1 人工智能
摘要
自然语言处理(NLP)应用(如低资源语料的命名实体识别(NER))并未从大语言模型(LLMs)发展的最新进展中受益,此类语料仍需要更大的标注数据集。本文提出了一种通过跨语言标注投影生成标注数据集翻译版本的方法。利用与语言无关的基于 BERT 的方法,这是一种以极少人力且仅使用已有开放数据资源来扩充低资源语料的高效方案。在评估半自动数据生成策略的质量与有效性时,定量与定性评价往往缺失。我们对跨语言标注投影方法的评估显示,所得数据集兼具有效性与高准确率。作为该方法的实际应用,我们呈现了用于医学实体检测的带语义信息法语标注资源(FRASIMED)的构建,这是一个包含 2051 个法语合成临床病例的标注语料库。该语料库现已向研究人员与从业者开放,用于开发和优化临床领域的法语自然语言处理(NLP)应用(https://zenodo.org/record/8355629),使其成为最大的带关联医学概念的法语开放标注语料库。
引用
@article{arxiv.2309.10770,
title = {FRASIMED: a Clinical French Annotated Resource Produced through Crosslingual BERT-Based Annotation Projection},
author = {Jamil Zaghir and Mina Bjelogrlic and Jean-Philippe Goldman and Soukaïna Aananou and Christophe Gaudet-Blavignac and Christian Lovis},
journal= {arXiv preprint arXiv:2309.10770},
year = {2025}
}