基于共识定义间接数据标注的临床机器学习有效性问题
机器学习
2023-11-07 v1 定量方法
应用统计
机器学习
摘要
我们展示了机器学习在医学疾病诊断这一重要应用领域中的有效性问题。该问题出现在训练数据中的目标标签由间接测量确定,而确定该间接测量所需的基本测量被包含在输入数据表示中时。在此类数据上训练的机器学习模型除了精确重构已知目标定义外学不到任何其他内容。此类模型在类似构造的测试数据上表现完美,但在定义性基本测量不可用或仅部分可用的真实世界样本上会灾难性地失效。我们提出了一种通用流程,可识别有问题数据集及在其上训练的黑盒机器学习模型,并在脓毒症早期预测任务上示例了我们的检测流程。
引用
@article{arxiv.2311.03037,
title = {Validity problems in clinical machine learning by indirect data labeling using consensus definitions},
author = {Michael Hagmann and Shigehiko Schamoni and Stefan Riezler},
journal= {arXiv preprint arXiv:2311.03037},
year = {2023}
}
备注
Extended Abstract presented at Machine Learning for Health (ML4H) symposium 2023, December 10th, 2023, New Orleans, United States, 11 pages