中文

糖尿病视网膜病变检测任务上的贝叶斯深度学习基准测试

机器学习 2022-11-24 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

贝叶斯深度学习旨在为深度神经网络配备精确量化其预测不确定性的能力,并有望使深度学习在安全关键的真实世界应用中更可靠。然而,现有贝叶斯深度学习方法未兑现此承诺;新方法持续在不切实际的测试平台上评估,这些平台未反映最需可靠不确定性量化的下游真实世界任务的复杂性。我们提出 RETINA Benchmark,一组准确反映此类复杂性并旨在评估安全关键场景下预测模型可靠性的真实世界任务。具体而言,我们整理了两个公开可用、展现不同程度糖尿病视网膜病变(一种可致盲的医学病症)的高分辨率人类视网膜图像数据集,并用它们设计了一套需要可靠预测不确定性量化的自动诊断任务。我们利用这些任务基于任务特定评估指标对成熟及最先进的贝叶斯深度学习方法进行基准测试。我们提供易于使用、遵循可复现性和软件设计原则的代码库以进行快速简便的基准测试。我们提供基准中所有方法的实现,以及在 100 TPU 天、20 GPU 天、400 种超参数配置和至少 6 个随机种子下计算的结果。

关键词

引用

@article{arxiv.2211.12717,
  title  = {Benchmarking Bayesian Deep Learning on Diabetic Retinopathy Detection Tasks},
  author = {Neil Band and Tim G. J. Rudner and Qixuan Feng and Angelos Filos and Zachary Nado and Michael W. Dusenberry and Ghassen Jerfel and Dustin Tran and Yarin Gal},
  journal= {arXiv preprint arXiv:2211.12717},
  year   = {2022}
}

备注

Published in Neural Information Processing Systems (NeurIPS) 2021 Datasets and Benchmarks Track Proceedings. First two authors contributed equally. Code available at https://rebrand.ly/retina-benchmark