中文

面向早期疾病发病预测中数据集偏移问题的分布外拒绝选项方法

机器学习 2025-05-27 v2 人工智能 应用统计

摘要

机器学习越来越多地被用于利用健康和医疗数据预测生活方式相关疾病的发病。然而,其预测准确性常常受到数据集偏移的阻碍,数据集偏移指的是训练数据集和测试数据集之间数据分布的差异。这个问题会导致分布外(OOD)数据的错误分类。为了减少实际环境中的数据集偏移,本文提出了用于预测的分布外拒绝选项(ODROP)。该方法集成一个 OOD 检测模型,以在预测阶段排除 OOD 数据。我们使用了两个具有数据集偏移的真实世界健康检查数据集(弘前和和歌山),涉及三个疾病发病预测任务:糖尿病、血脂异常和高血压。ODROP 方法的两个组成部分——OOD 检测模型和预测模型——均在弘前数据集上训练。我们使用 AUROC-拒绝率曲线图评估了 ODROP 在和歌山数据集上的有效性。在五种 OOD 检测方法(变分自编码器、神经网络集成标准差、神经网络集成认知、神经网络能量和神经网络高斯混合能量测量)中,变分自编码器方法表现出显著更高的稳定性和更大的 AUROC 提升。例如,在和歌山数据集中,糖尿病的 AUROC 从没有 ODROP 时的 0.80 提高到拒绝率为 31.1% 时的 0.90,血脂异常的 AUROC 从没有 ODROP 时的 0.70 提高到拒绝率为 34% 时的 0.76。此外,我们使用 SHAP 聚类将数据集偏移分为两类——显著影响预测的和不显著影响预测的。这项研究是首次将 OOD 检测应用于实际的健康和医疗数据,展示了其在数据集偏移情况下显著提高疾病预测模型准确性和可靠性的潜力。

关键词

引用

@article{arxiv.2405.19864,
  title  = {Out-of-distribution Reject Option Method for Dataset Shift Problem in Early Disease Onset Prediction},
  author = {Taisei Tosaki and Eiichiro Uchino and Ryosuke Kojima and Yohei Mineharu and Yuji Okamoto and Mikio Arita and Nobuyuki Miyai and Yoshinori Tamada and Tatsuya Mikami and Koichi Murashita and Shigeyuki Nakaji and Yasushi Okuno},
  journal= {arXiv preprint arXiv:2405.19864},
  year   = {2025}
}