深度神经网络倾向于可预测的外推
机器学习
2024-03-19 v2
摘要
传统观点认为,神经网络在面对分布外(OOD)输入时预测往往不可预测且过度自信。我们的工作对高维输入神经网络的这一假设进行重新评估。神经网络并非以任意方式外推,而是我们观察到,随着输入数据愈发 OOD,其预测常趋向一个常数值。此外,我们发现该值常紧密近似于最优常数解(OCS),即在未观测输入时使训练数据平均损失最小的预测。我们给出在 8 个具不同分布偏移(含 CIFAR10-C 与 ImageNet-R、S)、不同损失函数(交叉熵、MSE 与高斯 NLL)及不同架构(CNN 与 transformer)的数据集上展示此现象的结果。进而,我们给出该行为的解释,先经实证验证,再于涉及具 ReLU 激活的深度齐次网络的简化设定中作理论探究。最后,我们展示如何于实践中利用我们的洞见,以在存在 OOD 输入时实现风险敏感决策。
引用
@article{arxiv.2310.00873,
title = {Deep Neural Networks Tend To Extrapolate Predictably},
author = {Katie Kang and Amrith Setlur and Claire Tomlin and Sergey Levine},
journal= {arXiv preprint arXiv:2310.00873},
year = {2024}
}