中文

IBNorm:基于信息瓶颈原理的表示学习归一化方法

机器学习 2026-01-30 v2 人工智能

摘要

归一化是深度学习中的基本问题,但现有方法如 BatchNorm、LayerNorm 和 RMSNorm 均以方差为中心,通过强制零均值和单位方差来稳定训练,而不控制表示如何捕捉任务相关信息。我们提出基于信息瓶颈原理的IB-Inspired Normalization(IBNorm),这是一种简单而强大的家族方法,基于信息瓶颈原理。IBNorm 引入受限压缩操作,鼓励嵌入保留预测信息的同时抑制无关变量的变异性,从而生成更具信息性的表示,同时保持标准归一化的稳定性和兼容性。理论上,我们证明了IBNorm 实现了更高的IB值并获得更紧的泛化界限,优于方差中心方法。实证上,IBNorm 在大规模语言模型(LLaMA、GPT-2)和视觉模型(ResNet、ViT)上 consistently 优于 BatchNorm、LayerNorm 和 RMSNorm,互信息分析确认其在信息瓶颈方面表现更佳。代码将公开发布。

关键词

引用

@article{arxiv.2510.25262,
  title  = {IBNorm: Information-Bottleneck Inspired Normalization for Representation Learning},
  author = {Xiandong Zou and Jia Li and Xiaotong Yuan and Pan Zhou},
  journal= {arXiv preprint arXiv:2510.25262},
  year   = {2026}
}