中文

基于学习结构 Dropout 和输入依赖门控的 DynamicGate MLP 条件计算:面向功能塑性

机器学习 2026-03-18 v1 人工智能

摘要

Dropout 是一种代表性的正则化技术,通过随机失活隐藏单元在训练期间来缓解过拟合。相反,标准推理执行完整网络以稠密计算,其目标与机制不同于条件计算——后者中执行的操作取决于输入。本文将 DynamicGate-MLP 组织为单一框架,同时满足正则化视角和条件计算视角。我们不采用随机掩码,而是提出可学习的门控机制决定是否使用每个单元(或模块),抑制不必要的计算,同时实现与样本相关的执行,将计算集中于处理每个输入所必需的部分。为此,我们定义连续门控概率,在推理时从中生成离散执行掩码以选择执行路径。训练时通过对预期门控使用量的惩罚控制计算预算,并使用 Straight-Through Estimator (STE) 优化离散掩码。我们在 MNIST、CIFAR-10、Tiny-ImageNet、Speech Commands 和 PBMC3k 上评估 DynamicGate-MLP,并与各种 MLP 基线和 MoE 变体进行比较。计算效率通过门控激活比率和基于层权重的相对 MAC 指标进行比较,而非依赖于硬件和后端内核的 wall-clock latency。

关键词

引用

@article{arxiv.2603.16367,
  title  = {DynamicGate MLP Conditional Computation via Learned Structural Dropout and Input Dependent Gating for Functional Plasticity},
  author = {Yong Il Choi},
  journal= {arXiv preprint arXiv:2603.16367},
  year   = {2026}
}

备注

27 pages, 8 Figures