深度神经网络分类中的损失函数研究
机器学习
2017-02-21 v1
摘要
深度神经网络目前是最常用的分类器之一。尽管轻易取得非常好的性能,这些模型的最佳卖点之一是其模块化设计——人们可以方便地使架构适应特定需求,改变连接模式,附加专门层,尝试大量激活函数、归一化方案等。尽管能发现深度网络几乎各方面配置的惊人广泛传播,作者认为有一个元素代表性不足——在解决分类问题时,绝大多数论文和应用简单地使用对数损失。本文试图研究损失函数的特定选择如何影响深度模型及其学习动态,以及所得分类器对各种效应的鲁棒性。我们在经典数据集上进行实验,并提供一些额外的理论见解。特别地,我们通过提供关于期望误分类的概率解释,展示L1和L2损失令人惊讶地是深度网络合理的分类目标。我们还引入了两个通常不用作深度网络目标的损失,并展示它们是现有损失的可行替代。
引用
@article{arxiv.1702.05659,
title = {On Loss Functions for Deep Neural Networks in Classification},
author = {Katarzyna Janocha and Wojciech Marian Czarnecki},
journal= {arXiv preprint arXiv:1702.05659},
year = {2017}
}
备注
Presented at Theoretical Foundations of Machine Learning 2017 (TFML 2017)