你在该患者中看到了什么?临床NLP模型的行为测试
计算与语言
2021-12-01 v1 机器学习
摘要
基于临床笔记的决策支持系统有可能通过引导医生关注被忽视的风险来改善患者护理。预测患者结局是此类系统的重要组成部分,深度神经网络的使用已显示出有前景的结果。然而,这些网络学习的模式大多是黑箱的,且先前工作揭示了关于无意偏见复现的缺陷。因此我们引入了一个可扩展的测试框架,用于评估临床结局模型在输入变化时的行为。该框架有助于理解学习到的模式及其对模型决策的影响。在本工作中,我们将其应用于分析关于患者特征性别、年龄和种族的行为变化。我们对三个当前临床NLP模型的评估展示了这些特征对模型决策的具体影响。它们表明,即使在同一数据上微调,模型行为也存在显著差异,且声称性能最佳的模型未必学习到最具医学合理性的模式。
引用
@article{arxiv.2111.15512,
title = {What Do You See in this Patient? Behavioral Testing of Clinical NLP Models},
author = {Betty van Aken and Sebastian Herrmann and Alexander Löser},
journal= {arXiv preprint arXiv:2111.15512},
year = {2021}
}
备注
NeurIPS 2021 Research2Clinics Workshop, Bridging the Gap: From Machine Learning Research to Clinical Practice