面向临床实体抽取机器学习的鲁棒基准测试
计算与语言
2020-08-03 v1 机器学习
摘要
临床研究常需理解仅存在于自由文本临床笔记中的患者叙述要素。为将这些笔记转化为供下游使用的结构化数据,这些要素通常被抽取并规范化至医学词汇表。本文中,我们审计了最先进系统的性能并指出改进方向。我们发现,2019 年 n2c2 共享任务中临床实体规范化系统的高任务准确率具有误导性,其底层性能仍然脆弱。常见概念的规范化准确率高(95.3%),但训练数据中未出现概念的准确率则低得多(69.3%)。我们证明,当前方法部分受限于医学词汇表的不一致、现有标注模式的局限以及狭窄的评估技术。我们重构了临床实体抽取的标注框架,将这些问题纳入考量,以实现鲁棒的端到端系统基准测试。我们评估了两位标注者基于新框架的标注一致性,实体识别的 Jaccard 相似度为 0.73,实体规范化的协议度为 0.83。我们提出了前进路径,以解决已证实的创建参考标准以推动实体识别与规范化方法开发的需求。
引用
@article{arxiv.2007.16127,
title = {Robust Benchmarking for Machine Learning of Clinical Entity Extraction},
author = {Monica Agrawal and Chloe O'Connell and Yasmin Fatemi and Ariel Levy and David Sontag},
journal= {arXiv preprint arXiv:2007.16127},
year = {2020}
}