中文

基于来源反事实调整的多机构临床笔记鲁棒文本分类去混杂方法

计算与语言 2023-10-05 v1

摘要

自然语言处理(NLP)方法已广泛应用于临床任务。机器学习和深度学习方法已被用于提升临床 NLP 的性能。然而,这些方法需要足够大的训练数据集,且已有研究表明训练好的模型在不同机构间的迁移效果很差。这些问题促使人们推动跨机构的数据收集与整合,以构建准确且可移植的模型。但这会引入一种称为来源混杂(confounding by provenance)的偏差。当部署时来源特定的数据分布存在差异时,可能会损害模型性能。为解决此问题,我们在一个标注了药物滥用提及的多机构临床笔记数据集上,评估了后门调整(backdoor adjustment)用于文本分类的效用。利用一个为衡量对分布偏移鲁棒性而设计的评估框架,我们评估了后门调整的效用。我们的结果表明,后门调整能有效缓解混杂偏移。

关键词

引用

@article{arxiv.2310.02451,
  title  = {Backdoor Adjustment of Confounding by Provenance for Robust Text Classification of Multi-institutional Clinical Notes},
  author = {Xiruo Ding and Zhecheng Sheng and Meliha Yetişgen and Serguei Pakhomov and Trevor Cohen},
  journal= {arXiv preprint arXiv:2310.02451},
  year   = {2023}
}

备注

Accepted in AMIA 2023 Annual Symposium