医疗文书记录员:语料库构建与模型性能分析
计算与语言
2020-03-26 v1
摘要
利用医患问诊的音频创建辅助生成临床记录的工具有着日益增长的兴趣。受此目标驱动,并在临床医生与医疗文书记录员的帮助下,我们开发了一种用于抽取相关临床概念的标注方案。我们利用该标注方案标注了约 6k 个临床问诊的语料库。该语料库被用于训练一个最先进的标注模型。我们报告了本体、标注结果、模型性能以及对结果的详细分析。我们的结果表明,与药物相关的实体可以相对较高的准确率(0.90 F-score)被抽取,其次是症状(0.72 F-score)和病症(0.57 F-score)。在我们的任务中,我们不仅识别症状被提及的位置,还将其映射到临床记录中出现的规范形式。在不同类型的错误中,约 19-38% 的案例我们发现模型输出是正确的,且约 17-32% 的错误不影响临床记录。综合来看,本工作所开发的模型比 F-score 所反映的更为有用,使其成为具有前景的实际应用方法。
引用
@article{arxiv.2003.11531,
title = {The Medical Scribe: Corpus Development and Model Performance Analyses},
author = {Izhak Shafran and Nan Du and Linh Tran and Amanda Perry and Lauren Keyes and Mark Knichel and Ashley Domin and Lei Huang and Yuhui Chen and Gang Li and Mingqiu Wang and Laurent El Shafey and Hagen Soltau and Justin S. Paul},
journal= {arXiv preprint arXiv:2003.11531},
year = {2020}
}
备注
Extended version of the paper accepted at LREC 2020