中文

几乎正交:使第一层卷积核趋近于正交以提升模型泛化能力

计算机视觉与模式识别 2025-11-18 v2

摘要

尽管多年来卷积神经网络(CNN)训练方面取得了多项算法进展,但其在多个相关领域的泛化能力仍表现不佳,尤其是在生物识别和医学领域常见的开放集任务中。相比之下,人类拥有对未知视觉刺激的惊人泛化能力。高效编码假说认为,早期视觉结构(视网膜、侧网细胞核和原视觉皮层)会对输入进行变换,以减少冗余并最大化信息效率。这一早期视觉中冗余最小化机制,激发了CNN正则化技术的灵感,使卷积核趋于正交。然而,现有工作依赖矩阵投影、架构修改或特定权重初始化,这些方法经常过度限制网络的学习过程,并在损失函数计算中显著增加计算负担。本文引入一种灵活且轻量级的方法,通过使第一层卷积滤波器两两呈正交来对其子集进行正则化,从而减少提取特征的冗余性,同时避免对网络施加过度约束。我们在三个开放集视觉任务上进行评估(胸部X光图像异常检测、合成人脸检测和虹膜攻击检测),观察到使用本文提出的正则化器训练的模型在一般化能力方面优于最新方法。我们随文提供源代码。

关键词

引用

@article{arxiv.2504.16362,
  title  = {Almost Right: Making First-Layer Kernels Nearly Orthogonal Improves Model Generalization},
  author = {Colton R. Crum and Adam Czajka},
  journal= {arXiv preprint arXiv:2504.16362},
  year   = {2025}
}

备注

11 pages, 1 figure, 3 tables