中文

论深度神经网络中 logistic 与 softmax 损失的习得性质

机器学习 2020-03-06 v1 机器学习

摘要

用 logistic 和 softmax 损失训练的深度卷积神经网络(CNNs)在计算机视觉的视觉识别任务中取得了显著进展。当训练数据呈现类不平衡时,常使用类加权版本的 logistic 和 softmax 损失来提升非加权版本的性能。在本文中,为解释重加权机制,我们通过分析 CNN 训练收敛到局部极小后的必要条件(例如梯度等于零)来阐明这两种损失函数的习得性质。该分析立即为我们提供了对以下方面的理解:(1) 类重加权机制的定量效应:对使用 logistic 损失的二分类具有确定性效果,而对使用 softmax 损失的多分类则不确定;(2) logistic 损失通过一对多方法进行单标签多分类的劣势,这归因于学习过程中对负类(例如非目标类)预测概率的平均效应。厘清 logistic 损失的劣势与优势后,我们随后提出了一种用于多分类的新型重加权 logistic 损失。我们简单而有效的公式通过聚焦于学习困难非目标类(一对多中的目标类 vs. 非目标类)改进了普通 logistic 损失,并证明与 softmax 损失具有竞争力。我们在多个基准数据集上评估了我们的方法以证明其有效性。

关键词

引用

@article{arxiv.2003.02309,
  title  = {On the Learning Property of Logistic and Softmax Losses for Deep Neural Networks},
  author = {Xiangrui Li and Xin Li and Deng Pan and Dongxiao Zhu},
  journal= {arXiv preprint arXiv:2003.02309},
  year   = {2020}
}

备注

AAAI2020. Previously this appeared as arXiv:1906.04026v2, which was submitted as a replacement by accident