用于检测临床与非临床命名实体的生物医学流水线
计算与语言
2022-07-05 v1 信息检索
摘要
与生物医学命名实体识别任务相关的挑战有几点:现有方法考虑的实体类型较少(例如疾病、症状、蛋白质、基因);并且这些方法未考虑健康的社会决定因素(年龄、性别、就业、种族),即与患者健康相关的非医学因素。我们提出了一种机器学习流水线,在以往工作基础上做了如下改进:首先,它识别除标准类型外的许多生物医学实体类型;其次,它考虑与患者健康相关的非临床因素。该流水线还包含预处理、分词、映射嵌入查找和命名实体识别任务等阶段,以从自由文本中提取生物医学命名实体。我们展示了一个通过整理 COVID-19 病例报告所构建的新数据集。所提方法在五个基准数据集上以宏平均和微平均 F1 分数约 90 优于基线方法,在我们的数据集上宏平均和微平均 F1 分数分别为 95.25 和 93.18。
引用
@article{arxiv.2207.00876,
title = {A Biomedical Pipeline to Detect Clinical and Non-Clinical Named Entities},
author = {Shaina Raza and Brian Schwartz},
journal= {arXiv preprint arXiv:2207.00876},
year = {2022}
}
备注
Accepted in BioKDD 22