基准测试不确定性解耦:针对特定任务的专用不确定性
机器学习
2024-12-02 v2 机器学习
摘要
不确定性量化曾是一项单一任务,现已演变为一系列任务,包括弃权预测、分布外检测和偶然不确定性量化。最新的目标是解耦:构建多个估计器,每个估计器专门针对且仅针对一种不确定性来源。本文提出了首个不确定性解耦的基准测试。我们在 ImageNet 上重新实现并评估了广泛的不确定性估计器,涵盖从贝叶斯方法、证据方法到确定性方法,并应用于多种不确定性任务。我们发现,尽管近期有理论努力,但在实践中没有任何现有方法能提供成对的解耦不确定性估计器。我们还发现,专用不确定性任务比预测不确定性任务更难,后者表现出性能饱和现象。我们的结果既为针对特定任务使用何种不确定性估计器提供了实用建议,也揭示了面向任务和解耦不确定性的未来研究机遇。我们所有的重新实现和 Weights & Biases 日志均可在 https://github.com/bmucsanyi/untangle 获取。
引用
@article{arxiv.2402.19460,
title = {Benchmarking Uncertainty Disentanglement: Specialized Uncertainties for Specialized Tasks},
author = {Bálint Mucsányi and Michael Kirchhof and Seong Joon Oh},
journal= {arXiv preprint arXiv:2402.19460},
year = {2024}
}
备注
68 pages