中文

基于欧洲临床病例语料库的低资源信息抽取

计算与语言 2025-03-27 v1

摘要

我们发布了 E3C-3.0,一个医学领域的多语言数据集,其中包含标注了疾病和检验结果关系的临床病例。该数据集包括五种语言(英语、法语、意大利语、西班牙语和巴斯克语)的原生文本,以及从英语源文本翻译并投射到五种目标语言(希腊语、意大利语、波兰语、斯洛伐克语和斯洛文尼亚语)的文本。我们实现了一种半自动方法,包括基于大语言模型(large language models, LLMs)的自动标注投射以及人工修订。我们展示了若干实验,表明当前最先进的大语言模型能够通过在 E3C-3.0 数据集上进行微调而获益。我们还表明,不同语言间的迁移学习非常有效,可缓解数据稀缺问题。最后,我们比较了在原生数据和投射数据上的性能。数据已在 https://huggingface.co/collections/NLP-FBK/e3c-projected-676a7d6221608d60e4e9fd89 发布。

关键词

引用

@article{arxiv.2503.20568,
  title  = {Low-resource Information Extraction with the European Clinical Case Corpus},
  author = {Soumitra Ghosh and Begona Altuna and Saeed Farzi and Pietro Ferrazzi and Alberto Lavelli and Giulia Mezzanotte and Manuela Speranza and Bernardo Magnini},
  journal= {arXiv preprint arXiv:2503.20568},
  year   = {2025}
}