中文

mHC-lite:你不需要20次Sinkhorn-Knopp迭代

机器学习 2026-01-12 v1 人工智能

摘要

超连接(HC)通过引入动态残差矩阵来混合多个残差流中的信息,从而泛化了残差连接,加速了深度神经网络的收敛。然而,不受约束的残差矩阵可能会损害训练稳定性。为了解决这个问题,DeepSeek的流形约束超连接(mHC)通过迭代的Sinkhorn-Knopp(SK)归一化,将这些矩阵近似投影到Birkhoff多胞体上。我们发现了这种方法的两个局限性:(i)有限的SK迭代不能保证精确的双重随机性,留下了一个可能随网络深度累积并破坏稳定性的近似差距;(ii)高效的SK实现需要高度专业化的CUDA内核,这提高了工程门槛并降低了可移植性。受Birkhoff-von Neumann定理的启发,我们提出了mHC-lite,这是一种简单的重参数化方法,通过将置换矩阵的凸组合显式地构造为双重随机矩阵。这种方法通过构造保证了精确的双重随机性,并且可以仅使用原生矩阵运算来实现。大量实验表明,mHC-lite在性能上与mHC相当或更优,同时在使用朴素实现时实现了更高的训练吞吐量,并消除了在HC和mHC中观察到的残差不稳定性。代码已公开在https://github.com/FFTYYY/mhc-lite。

关键词

引用

@article{arxiv.2601.05732,
  title  = {mHC-lite: You Don't Need 20 Sinkhorn-Knopp Iterations},
  author = {Yongyi Yang and Jianyang Gao},
  journal= {arXiv preprint arXiv:2601.05732},
  year   = {2026}
}