中文

评估语言模型从患者生成文本中提取主诉的鲁棒性

计算与语言 2019-11-19 v1

摘要

从患者生成文本中自动分类主诉,是在无需人工干预情况下开发可扩展患者分诊平台的关键第一步。在本工作中,我们评估了多种主诉分类方法,使用了一个新颖的主诉(CC)数据集,该数据集包含约200,000条患者生成的就诊原因记录,映射到一组795个离散主诉。我们考察了若干在无关文本以及CC数据集上微调的双向transformer(BERT)模型的使用,并将其性能与TF-IDF基线进行对比。我们的评估包含三个部分:(1)原数据集的随机测试留出集;(2)一个"拼写错误集",由测试集中手工挑选的子集构成,其中每条记录至少有一个拼写错误;(3)一个独立的实验者生成的自由文本集。我们发现TF-IDF模型在测试集上的表现显著优于最强的基于BERT的模型(最佳BERT PR-AUC 0.3597±0.00410.3597 \pm 0.0041 vs TF-IDF PR-AUC 0.3878±0.01480.3878 \pm 0.0148, p=7105p=7\cdot 10^{-5}),且在拼写错误集上与后者统计上相当(最佳BERT PR-AUC 0.2579±0.00790.2579 \pm 0.0079 vs TF-IDF PR-AUC 0.2733±0.01300.2733 \pm 0.0130, p=0.06p=0.06)。然而,当检查模型在实验者生成查询上的预测时,关于TF-IDF基线的鲁棒性出现了一些担忧。我们的结果表明,在某些任务中,简单的语言嵌入基线可能非常有效;然而,真正理解其鲁棒性需要进一步分析。

关键词

引用

@article{arxiv.1911.06915,
  title  = {Evaluating robustness of language models for chief complaint extraction from patient-generated text},
  author = {Ilya Valmianski and Caleb Goodwin and Ian M. Finn and Naqi Khan and Daniel S. Zisook},
  journal= {arXiv preprint arXiv:1911.06915},
  year   = {2019}
}

备注

Machine Learning for Health (ML4H) at NeurIPS 2019 - Extended Abstract