中文

前向对齐,反向适应:逻辑门网络中离散化鸿沟的闭合

机器学习 2026-03-17 v1 人工智能

摘要

在神经网络模型中,软混合固定候选组件(如逻辑门和子网络)常用于训练中的稳定优化,而推断时通常使用硬选择。这引出训练-推断不匹配的疑问。我们通过分离前向传播计算(硬选择 vs 软混合)和随机性(有无 Gumbel 噪声),分析了这一鸿沟。以逻辑门网络为测试平台,我们观察到四种方法的不同行为:Hard-ST 通过构造实现零选择鸿沟;Gumbel-ST 在训练成功时实现接近零鸿沟,但在低温度下会出现精度崩溃;Soft-Mix 仅在低温度下通过权重集中实现小鸿沟;Soft-Gumbel 尽管有 Gumbel 噪声,仍表现出大鸿沟,证明噪声本身并不能缩小鸿沟。我们提出 CAGE(置信度自适应梯度估计)以保持梯度流动,同时保持前向对齐。在逻辑门网络上,采用 CAGE 的 Hard-ST 在 MNIST 上实现超过 98% 的准确率,在 CIFAR-10 上实现超过 58% 的准确率,所有温度下均实现零选择鸿沟,而不使用 CAGE 的 Gumbel-ST 会出现 47 分点的精度崩溃。

关键词

引用

@article{arxiv.2603.14157,
  title  = {Align Forward, Adapt Backward: Closing the Discretization Gap in Logic Gate Networks},
  author = {Youngsung Kim},
  journal= {arXiv preprint arXiv:2603.14157},
  year   = {2026}
}