贝叶斯深度学习在糖尿病视网膜病变任务中鲁棒性的系统性比较
机器学习
2019-12-24 v1 机器学习
图像与视频处理
摘要
贝叶斯深度学习(BDL)方法的评估具有挑战性。我们常常希望评估方法的鲁棒性与可扩展性,判断新工具是否比旧工具给出“更好”的不确定性估计。这些评估对于从业者在选择在其上构建应用的 BDL 工具时至关重要。当前流行的 BDL 方法评估(如 UCI 实验)存在不足:在这些实验中表现出色的方法,在诸如医疗或自动驾驶等应用中往往失败,这表明该领域迫切需要有新的基准。我们提出了一个新的 BDL 基准,包含一组多样化的任务,其灵感来自糖尿病视网膜病变诊断这一真实世界的医学影像应用。我们考虑视觉输入(512x512 RGB 视网膜图像),其中模型不确定性用于医学预筛查——即当模型诊断不确定时将患者转诊给专家。随后根据源自专家领域的指标对方法进行排序,以反映模型不确定性在自动化诊断中的真实世界使用。我们开发了该应用下的多个任务,包括分布外检测与对分布偏移的鲁棒性。然后我们对多种任务上经过充分调参的 BDL 技术进行系统性比较。由我们的比较可得,一些解决 UCI 等基准的现有技术将其不确定性“过拟合”到数据集——当在我们的基准上评估时,其相对于更简单的基线表现不佳。该基准的代码、其基线以及一个用于评估新 BDL 工具的简单 API 已在 https://github.com/oatml/bdl-benchmarks 提供。
引用
@article{arxiv.1912.10481,
title = {A Systematic Comparison of Bayesian Deep Learning Robustness in Diabetic Retinopathy Tasks},
author = {Angelos Filos and Sebastian Farquhar and Aidan N. Gomez and Tim G. J. Rudner and Zachary Kenton and Lewis Smith and Milad Alizadeh and Arnoud de Kroon and Yarin Gal},
journal= {arXiv preprint arXiv:1912.10481},
year = {2019}
}