交叉熵损失的误用与善用:现代深度学习案例研究
机器学习
2020-11-11 v1 机器学习
摘要
现代深度学习主要是一门实验科学,其中的经验性进展偶尔以牺牲概率严谨性为代价。此处我们聚焦于这样一个例子;即使用分类交叉熵损失来建模并非严格分类、而是在单纯形上取值的数据。该做法在带有标签平滑的神经网络架构以及 actor-mimic 强化学习等中是标准的。借助最近发现的连续-分类分布,我们提出了受概率启发对这些模型的替代方案,提供了一种更合乎原则且在理论上更具吸引力的途径。通过细致的实验,包括一项消融研究,我们明确了这些模型中实现更优表现的潜力,从而凸显了恰当概率处理的必要性,并阐明了其若干失效模式。
引用
@article{arxiv.2011.05231,
title = {Uses and Abuses of the Cross-Entropy Loss: Case Studies in Modern Deep Learning},
author = {Elliott Gordon-Rodriguez and Gabriel Loaiza-Ganem and Geoff Pleiss and John P. Cunningham},
journal= {arXiv preprint arXiv:2011.05231},
year = {2020}
}