跨多个激活稀疏性情景的联合训练
机器学习
2026-03-04 v1 人工智能
摘要
深度神经网络的泛化仍只部分被理解。鼓励受生物系统更强泛化倾向的假设启发我们探索鲁棒的内部表征应在稠密和稀疏激活情景下保持有效的假设。为测试这一想法,我们引入一种简单训练策略,对隐藏激活施加全局 top-k 约束,并通过逐步压缩和定期重置方式反复将单个模型循环通过多个激活预算。使用 CIFAR-10 不做数据增强和 WRN-28-4 主干网络,我们在单次实验中发现两种自适应 keep 比例控制策略均优于稠密基线训练。这一初步结果表明,跨多个激活稀疏性情景的联合训练可能提供一种简单且有效的提升泛化途径。
引用
@article{arxiv.2603.03131,
title = {Joint Training Across Multiple Activation Sparsity Regimes},
author = {Haotian Wang},
journal= {arXiv preprint arXiv:2603.03131},
year = {2026}
}