深度特征学习中的BCE与CE对比
机器学习
2025-05-12 v1
摘要
在训练分类模型时,期望学到的特征在类内紧凑,并能很好地分离不同类别。作为训练分类模型的主导损失函数,最小化交叉熵(CE)损失可以最大化紧凑性和区分性,即达到神经坍缩(NC)。最近的研究表明,二元交叉熵(BCE)在多类任务中也表现良好。本文比较了BCE和CE在深度特征学习中的表现。我们首次证明,BCE在达到其最小值时也能最大化类内紧凑性和类间区分性,即导致NC。我们指出,CE在模型训练中衡量决策分数的相对值,通过逐个分类样本来隐式增强特征属性。相比之下,BCE衡量决策分数的绝对值,并将所有样本的正/负决策分数调整到统一的高/低水平。同时,BCE中的分类器偏置对决策分数施加了实质性约束,以在训练中显式增强特征属性。实验结果与上述分析一致,并表明BCE可以改善分类性能,并在样本特征中带来更好的紧凑性和区分性。代码将发布。
引用
@article{arxiv.2505.05813,
title = {BCE vs. CE in Deep Feature Learning},
author = {Qiufu Li and Huibin Xiao and Linlin Shen},
journal= {arXiv preprint arXiv:2505.05813},
year = {2025}
}
备注
Accepted by ICML2025