基于语义数据集距离量化 BERT 诊断模型跨医学专科的泛化能力
计算与语言
2021-02-22 v3
摘要
医疗领域的深度学习模型可能无法在来自未见语料的数据上泛化。此外,目前尚无定量指标能够说明现有模型在新数据上的表现。先前的研究表明,医学笔记的 NLP 模型在不同机构间的泛化能力存在差异,但忽略了医疗组织的其他层级。我们使用来自 MIMIC-III 的 EHR 句子,测量了 SciBERT 诊断情感分类器在医学专科之间的泛化能力。在一个专科上训练的模型在内部测试集上的表现优于混合或外部测试集(平均 AUC 分别为 0.92、0.87 和 0.83;p = 0.016)。当模型在更多专科上训练时,其测试表现更好(p < 1e-4)。模型在新语料上的表现与训练和测试句子内容的相似度直接相关(p < 1e-4)。未来的研究应评估泛化的其他维度,以确保深度学习模型在机构、专科和实践之间实现其预期目的。
引用
@article{arxiv.2008.06606,
title = {Quantification of BERT Diagnosis Generalizability Across Medical Specialties Using Semantic Dataset Distance},
author = {Mihir P. Khambete and William Su and Juan Garcia and Marcus A. Badgeley},
journal= {arXiv preprint arXiv:2008.06606},
year = {2021}
}
备注
20 pages, 10 figures