中文

分类任务中平方损失与交叉熵训练的神经架构评估

机器学习 2021-10-26 v5 机器学习

摘要

现代用于分类任务的神经架构通常使用交叉熵损失进行训练,人们普遍认为它在经验上优于平方损失。在这项工作中,我们提供的证据表明这种观点可能缺乏充分依据。我们探索了几种主要的神经架构以及一系列用于自然语言处理(NLP)、自动语音识别(ASR)和计算机视觉任务的标准基准数据集,结果表明,即使均衡了计算资源,这些架构在使用与文献报道相同的超参数设置下,用平方损失训练时性能相当或更好。实际上,我们观察到平方损失在绝大多数 NLP 和 ASR 实验中产生了更好的结果。交叉熵损失在计算机视觉任务上似乎略有优势。我们认为,几乎没有令人信服的经验或理论证据表明交叉熵损失具有明确的优势。事实上,在我们的实验中,几乎所有非视觉任务的性能都可以通过切换到平方损失而得到提升,有时提升显著。此外,使用平方损失训练似乎对初始化中的随机性不那么敏感。我们主张,使用平方损失进行分类训练需要成为现代深度学习最佳实践的一部分,与交叉熵损失同等重要。

关键词

引用

@article{arxiv.2006.07322,
  title  = {Evaluation of Neural Architectures Trained with Square Loss vs Cross-Entropy in Classification Tasks},
  author = {Like Hui and Mikhail Belkin},
  journal= {arXiv preprint arXiv:2006.07322},
  year   = {2021}
}

备注

An extended version of the paper published at ICLR2021. Added material includes evaluations of Transformer architectures