评估语言模型从患者生成文本中提取主诉的鲁棒性
计算与语言
2019-11-19 v1
摘要
从患者生成文本中自动分类主诉,是在无需人工干预情况下开发可扩展患者分诊平台的关键第一步。在本工作中,我们评估了多种主诉分类方法,使用了一个新颖的主诉(CC)数据集,该数据集包含约200,000条患者生成的就诊原因记录,映射到一组795个离散主诉。我们考察了若干在无关文本以及CC数据集上微调的双向transformer(BERT)模型的使用,并将其性能与TF-IDF基线进行对比。我们的评估包含三个部分:(1)原数据集的随机测试留出集;(2)一个"拼写错误集",由测试集中手工挑选的子集构成,其中每条记录至少有一个拼写错误;(3)一个独立的实验者生成的自由文本集。我们发现TF-IDF模型在测试集上的表现显著优于最强的基于BERT的模型(最佳BERT PR-AUC vs TF-IDF PR-AUC , ),且在拼写错误集上与后者统计上相当(最佳BERT PR-AUC vs TF-IDF PR-AUC , )。然而,当检查模型在实验者生成查询上的预测时,关于TF-IDF基线的鲁棒性出现了一些担忧。我们的结果表明,在某些任务中,简单的语言嵌入基线可能非常有效;然而,真正理解其鲁棒性需要进一步分析。
引用
@article{arxiv.1911.06915,
title = {Evaluating robustness of language models for chief complaint extraction from patient-generated text},
author = {Ilya Valmianski and Caleb Goodwin and Ian M. Finn and Naqi Khan and Daniel S. Zisook},
journal= {arXiv preprint arXiv:1911.06915},
year = {2019}
}
备注
Machine Learning for Health (ML4H) at NeurIPS 2019 - Extended Abstract