中文

医疗诊断模型分布偏移鲁棒性的考量

机器学习 2024-10-28 v1 机器学习

摘要

我们考虑医疗诊断模型背景下的分布偏移鲁棒性问题,其中预测目标 YY(例如疾病的存在)在因果上位于观测值 XX(例如生物标志物)的上游。例如,当训练数据是在具有特定人口统计学特征的患者群体中收集的领域内采集的,而模型被部署在来自不同人口群体的患者上时,就可能发生分布偏移。在应用于医疗健康的机器学习领域,通常在不考虑患者进一步信息的情况下从 XX 预测 YY。然而,除了疾病 YY 对生物标志物 XX 的直接影响外,预测模型可能会学习利用 XXYY 之间的混淆依赖关系(或捷径),而这些依赖关系在某些分布偏移下是不稳定的。在这项工作中,我们强调了医疗环境中常见的一种数据生成机制,并讨论了如何应用因果性文献中的最新理论结果来构建鲁棒的预测模型。我们从理论上说明了为什么在所研究的设定中,忽略协变量以及常见的不变学习方法通常不会产生鲁棒的预测器,而将某些协变量纳入预测模型则会产生鲁棒的预测器。在一项广泛的仿真研究中,我们展示了不同预测器在各种数据生成过程中的鲁棒性(或其缺失)。最后,我们使用 PTB-XL 数据集(一个带有标注的 ECG 记录公开数据集)分析了不同方法的性能。

关键词

引用

@article{arxiv.2410.19575,
  title  = {Considerations for Distribution Shift Robustness of Diagnostic Models in Healthcare},
  author = {Arno Blaas and Adam Goliński and Andrew Miller and Luca Zappella and Jörn-Henrik Jacobsen and Christina Heinze-Deml},
  journal= {arXiv preprint arXiv:2410.19575},
  year   = {2024}
}