深度学习分类器中交叉熵并非必需——ISBE 误差足矣
机器学习
2023-11-29 v1
摘要
在深度学习分类器中,代价函数通常采取 SoftMax 与 CrossEntropy 函数组合的形式。SoftMax 单元将模型网络预测的分数转换为对象属于给定类别的程度(概率)评估。另一方面,CrossEntropy 衡量该预测与目标分数分布之间的发散程度。本文引入 ISBE 功能,论证了在深度学习分类器中计算交叉熵是冗余的这一论点。我们不仅可以省略熵的计算,而且在反向传播过程中,无需将误差导向归一化单元以进行反向变换,而是将误差直接发送至模型网络。以感知机与卷积网络作为 MNIST 集合图像分类器为例,观察到对于 ISBE,结果不仅在使用 SoftMax 时未退化,在使用 Sigmoid、Tanh 或其硬变体 HardSigmoid 与 HardTanh 等其他激活函数时亦如此。此外,在前向与反向阶段总时间内可节省至多百分之三的时间。本文主要面向对深度模型学习感兴趣的程序员与学生。例如,其通过代码片段展示了实现 ISBE 单元的可能方式,并形式化证明了 softmax trick 仅适用于带位移的 softmax 函数类。
引用
@article{arxiv.2311.16357,
title = {Cross Entropy in Deep Learning of Classifiers Is Unnecessary -- ISBE Error is All You Need},
author = {Wladyslaw Skarbek},
journal= {arXiv preprint arXiv:2311.16357},
year = {2023}
}
备注
18 pages, 4 figures