中文

深度特征学习中的BCE与CE对比

机器学习 2025-05-12 v1

摘要

在训练分类模型时,期望学到的特征在类内紧凑,并能很好地分离不同类别。作为训练分类模型的主导损失函数,最小化交叉熵(CE)损失可以最大化紧凑性和区分性,即达到神经坍缩(NC)。最近的研究表明,二元交叉熵(BCE)在多类任务中也表现良好。本文比较了BCE和CE在深度特征学习中的表现。我们首次证明,BCE在达到其最小值时也能最大化类内紧凑性和类间区分性,即导致NC。我们指出,CE在模型训练中衡量决策分数的相对值,通过逐个分类样本来隐式增强特征属性。相比之下,BCE衡量决策分数的绝对值,并将所有样本的正/负决策分数调整到统一的高/低水平。同时,BCE中的分类器偏置对决策分数施加了实质性约束,以在训练中显式增强特征属性。实验结果与上述分析一致,并表明BCE可以改善分类性能,并在样本特征中带来更好的紧凑性和区分性。代码将发布。

关键词

引用

@article{arxiv.2505.05813,
  title  = {BCE vs. CE in Deep Feature Learning},
  author = {Qiufu Li and Huibin Xiao and Linlin Shen},
  journal= {arXiv preprint arXiv:2505.05813},
  year   = {2025}
}

备注

Accepted by ICML2025