基于来源反事实调整的多机构临床笔记鲁棒文本分类去混杂方法
计算与语言
2023-10-05 v1
摘要
自然语言处理(NLP)方法已广泛应用于临床任务。机器学习和深度学习方法已被用于提升临床 NLP 的性能。然而,这些方法需要足够大的训练数据集,且已有研究表明训练好的模型在不同机构间的迁移效果很差。这些问题促使人们推动跨机构的数据收集与整合,以构建准确且可移植的模型。但这会引入一种称为来源混杂(confounding by provenance)的偏差。当部署时来源特定的数据分布存在差异时,可能会损害模型性能。为解决此问题,我们在一个标注了药物滥用提及的多机构临床笔记数据集上,评估了后门调整(backdoor adjustment)用于文本分类的效用。利用一个为衡量对分布偏移鲁棒性而设计的评估框架,我们评估了后门调整的效用。我们的结果表明,后门调整能有效缓解混杂偏移。
引用
@article{arxiv.2310.02451,
title = {Backdoor Adjustment of Confounding by Provenance for Robust Text Classification of Multi-institutional Clinical Notes},
author = {Xiruo Ding and Zhecheng Sheng and Meliha Yetişgen and Serguei Pakhomov and Trevor Cohen},
journal= {arXiv preprint arXiv:2310.02451},
year = {2023}
}
备注
Accepted in AMIA 2023 Annual Symposium