中文

基于布尔坦因影响函数测量随机数据复杂度

机器学习 2024-07-22 v2

摘要

估计模型在测试点上预测不确定性的能力是确保在分布漂移下可靠性和校准的关键部分。最小描述长度方法使用预测归一化最大似然(pNML)分布来解决此问题,该分布考虑数据点的所有可能标签,如果其他标签也与模型和训练数据一致,则降低对预测的置信度。在本工作中,我们提出了IF-COMP,这是pNML分布的一个可扩展且高效的近似方法,通过温度缩放的布尔坦因影响函数对模型进行线性化。IF-COMP可用于在测试点上生成校准良好的预测,以及在标记和未标记设置中测量复杂度。我们在不确定性校准、误标签检测和OOD检测任务上对IF-COMP进行了实验验证,其中它一致地匹配或优于强大的基线方法。

关键词

引用

@article{arxiv.2406.02745,
  title  = {Measuring Stochastic Data Complexity with Boltzmann Influence Functions},
  author = {Nathan Ng and Roger Grosse and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2406.02745},
  year   = {2024}
}