单隐层 MLP 是否可以吸收其自身的跳跃连接?
机器学习
2026-04-28 v1
摘要
我们研究当单个隐藏层的 MLP 周围存在跳跃连接时,是否存在可以将其吸收到相同宽度、无跳跃连接 MLP 中的情况。我们首先指出,对于跳跃分支为可逆线性映射(包括 Hyper-Connections 及其流形约束变体)的网络结构,问题可化简为恒等跳跃情况。对于次数为 的齐次激活函数(如 ReLU 和 ReGLU),通过次数论可得吸收不可实现。对于门控激活函数且其门在原点处可导且满足 (如 SwiGLU 和 GeGLU),线性化论证同样得出不可吸收的结论。这些不可吸收结果可推广至任意深度:若干个使用上述激活函数的残差块的组合,无法由相同宽度、无残差块的组合来实现。对于未门控的 ReLU 和 GELU 情况则更为复杂。在权力矩阵为一般情况时,仅当存在大小至少为 的指数集 满足 时,单块层面的吸收才成立。该条件为非一般情况(在连续权重分布下几乎总是失败),因此相同宽度的跳跃连接 MLP 与无残差 MLP 在函数类上通常是互斥的。对于深层 ReLU 或 GELU 块的互斥性是否仍然成立尚未确定。
引用
@article{arxiv.2604.23705,
title = {Can an MLP Absorb Its Own Skip Connection?},
author = {Antonij Mijoski and Marko Karbevski},
journal= {arXiv preprint arXiv:2604.23705},
year = {2026}
}