专家不作弊:通过预测配对来学习你不知道的事
机器学习
2024-05-29 v2
摘要
识别模型对其训练时所依据的随机真实世界过程了解多少,对于确保它避免产生不正确或“幻觉”答案或采取不安全行动至关重要。但这对于生成模型来说是困难的,因为概率预测无法区分每次响应的噪声(偶然不确定性)和对过程知识的缺乏(认知不确定性),并且现有的认知不确定性量化技术在模型欠拟合时往往过于自信。我们提出了一种通用策略,用于教导模型既近似,又估计与之间的剩余差距:训练它预测从真实条件分布中抽取的成对独立响应,允许它在预测一个响应时通过观察另一个响应来“作弊”,然后测量它作弊的程度。值得注意的是,我们证明,擅长作弊(即每当作弊能改善预测时就作弊)等价于达到二阶校准,这是普通校准的一个原则性扩展,使我们能够为构建可证明正确的频率学派置信区间,并以高概率检测错误响应。我们通过实验证明,我们的方法在模糊图像分类、(合成)语言建模和部分可观测导航任务中,能够准确估计模型不知道多少,优于现有技术。
引用
@article{arxiv.2402.08733,
title = {Experts Don't Cheat: Learning What You Don't Know By Predicting Pairs},
author = {Daniel D. Johnson and Daniel Tarlow and David Duvenaud and Chris J. Maddison},
journal= {arXiv preprint arXiv:2402.08733},
year = {2024}
}
备注
Accepted at ICML 2024. 9 pages, 6 figures