中文

基于信息论的贪心分层流量标志识别训练

机器学习 2025-11-03 v1 人工智能

摘要

现代深度神经网络(DNN)通常以全局交叉熵损失进行监督式端到端训练:神经元需要存储其输出权重;训练在前向传递(计算)和自上而下的反向传递(学习)之间交替进行,这在生物学上往往不符合常规。或者,贪心分层训练消除了交叉熵损失和反向传播的需求。通过避免计算中间梯度和存储中间输出,它减少了内存使用,有助于缓解消失或爆炸梯度等问题。然而,大多数现有的分层训练方法仅在相对较小的数据集上评估过,或针对简单深层架构。本文首先通过信息论视角系统性地分析了使用随机梯度下降(SGD)训练的流行卷积神经网络(CNN)的训练动力学。我们的发现表明,网络从底部到顶部逐层收敛,信息流遵循马尔可夫信息瓶颈原理。基于这些观察,我们提出一种基于最近发展的确定性信息瓶颈(DIB)和基于矩阵的 R\'enyi 的 α\alpha-阶熵函数的新型分层训练方法。具体而言,每个层与一个连接到输出层的辅助分类器联合训练,从而实现对最小充分任务相关表征的学习。我们在 CIFAR-10 和 CIFAR-100 上使用现代深层 CNN 进行了实证验证,并进一步演示了其适用于涉及交通标志识别的实际任务。我们的做法不仅超过了现有的分层训练基准,还达到了与 SGD 相当的性能。

关键词

引用

@article{arxiv.2510.27651,
  title  = {Information-Theoretic Greedy Layer-wise Training for Traffic Sign Recognition},
  author = {Shuyan Lyu and Zhanzimo Wu and Junliang Du},
  journal= {arXiv preprint arXiv:2510.27651},
  year   = {2025}
}