SemClinBr——用于葡萄牙语临床 NLP 任务的多机构多专科语义标注语料库
计算与语言
2022-05-12 v1 信息检索
摘要
从电子健康记录(EHR)中提取患者信息的研究数量庞大,导致对标注语料库的需求增加,这些语料库是开发和评估自然语言处理(NLP)算法的宝贵资源。在英语范围之外缺乏多用途临床语料库,尤其是在巴西葡萄牙语中,这一现象十分突出,并严重影响了生物医学 NLP 领域的科学进展。在本研究中,我们使用来自多个医疗专科、文档类型和机构的临床文本开发了一个语义标注语料库。我们呈现如下内容:(1)列出先前研究的共同方面和经验教训的调查;(2)可复制并指导其他标注计划的细粒度标注模式;(3)专注于标注建议功能的基于 Web 的标注工具;(4)标注的内在和外在评估。这项工作的成果是 SemClinBr,一个拥有 1,000 份临床记录、标注了 65,117 个实体和 11,263 个关系、可支持多种临床 NLP 任务并促进葡萄牙语 EHR 二次利用的语料库。
引用
@article{arxiv.2001.10071,
title = {SemClinBr -- a multi institutional and multi specialty semantically annotated corpus for Portuguese clinical NLP tasks},
author = {Lucas Emanuel Silva e Oliveira and Ana Carolina Peters and Adalniza Moura Pucca da Silva and Caroline P. Gebeluca and Yohan Bonescki Gumiel and Lilian Mie Mukai Cintho and Deborah Ribeiro Carvalho and Sadid A. Hasan and Claudia Maria Cabral Moro},
journal= {arXiv preprint arXiv:2001.10071},
year = {2022}
}