中文

交叉熵损失的基于边际的替代方案

机器学习 2025-01-22 v1 计算机视觉与模式识别

摘要

交叉熵(CE)损失是训练深度神经网络执行分类任务的事实标准。然而,CE 训练的深度神经网络在鲁棒性和泛化方面存在挑战。为缓解这些问题,我们提出了高误差边际(HEM)损失,这是一种多类边际损失的变体,克服了其他边际损失的训练问题。我们在广泛的架构和数据集上对 HEM 进行了广泛评估。我们发现,HEM 在各种任务上均优于交叉熵损失:未知类别拒绝、对抗鲁棒性、使用不平衡数据学习、持续学习以及语义分割(像素级分类任务)。尽管所有训练超参数都为 CE 损失所选,HEM 在干净准确率方面仅劣于 CE,且这种差异不显著。我们还将 HEM 与针对特定任务提高性能的专用损失进行比较。LogitNorm 是一种在未知类别拒绝方面实现最佳性能的损失,对于该任务产生类似 HEM 的性能,但在持续学习和语义分割方面表现更差。Logit-adjusted 损失是为不平衡数据设计的损失,对该任务具有优异结果,但在未知类别拒绝和语义分割方面表现更差。DICE 是一种流行的语义分割损失,在所有任务中(包括语义分割)均不如 HEM 损失。因此,HEM 常常优于专用损失,与它们不同,HEM 是 CE 损失的通用替代方案。

关键词

引用

@article{arxiv.2501.12191,
  title  = {A margin-based replacement for cross-entropy loss},
  author = {Michael W. Spratling and Heiko H. Schütt},
  journal= {arXiv preprint arXiv:2501.12191},
  year   = {2025}
}

备注

Code: https://codeberg.org/mwspratling/HEMLoss