利用数据集偏移检测实现可靠可信的医疗保健机器学习
机器学习
2021-10-28 v1
摘要
机器学习(ML)模型在未见数据上不可预测的行为,尤其在健康领域,引发了对其安全性的严重担忧,因为错误的后果可能是致命的。本文中,我们探讨使用最先进的分布外(out-of-distribution)检测器来实现可靠且可信的诊断预测的可行性。我们选取了与多种健康状况(如皮肤癌、肺音和帕金森病)相关、使用多种输入数据类型(如图像、音频和运动数据)的公开深度学习模型。我们证明这些模型在分布外数据集上表现出不合理的预测。我们表明,基于马哈拉诺比斯距离和 Gram 矩阵的分布外检测方法,能够以高准确率检测出运行于不同模态的健康模型所对应的分布外数据。我们随后将分布外分数转化为人类可解释的置信分数(CONFIDENCE SCORE),以研究其对用户与医疗 ML 应用交互的影响。我们的用户研究表明,置信分数帮助参与者仅信任高分结果以做出医疗决策,并忽略低分结果。通过本工作,我们证明数据集偏移对于高风险 ML 应用(如医学诊断和医疗保健)向用户提供可靠可信的预测而言是关键信息。
引用
@article{arxiv.2110.14019,
title = {Reliable and Trustworthy Machine Learning for Health Using Dataset Shift Detection},
author = {Chunjong Park and Anas Awadalla and Tadayoshi Kohno and Shwetak Patel},
journal= {arXiv preprint arXiv:2110.14019},
year = {2021}
}
备注
Neu