SymbolicLight V1:基于高激活稀疏性和亚十亿规模预训练的脉冲门控双路径语言模型
计算与语言
2026-05-21 v1 人工智能
摘要
原生训练的脉冲语言模型难以结合Transformer-like语言质量、稳定的多域预训练和高激活稀疏性。我们提出SymbolicLight V1,一种脉冲门控双路径语言模型,将二值Leaky Integrate-and-Fire脉冲动力学与连续残差流相结合。其Dual-Path SparseTCAM模块用指数衰减聚合路径代替稠密自注意力,以实现长程记忆,并用脉冲门控局部注意力路径实现短程精度,辅以动态上下文相关解码头和双语tokenizer。一个1.94亿参数的SymbolicLight V1模型从头在30亿token规模的中英语料库上训练,达到held-out验证PPL 8.88-8.93(跨四个独立运行),实现>89%的per-element激活稀疏性。它在PPL上落后于GPT-2 201M约7.7%,但优于GPT-2 124M。在匹配0.5B-token训练预算下的组件消融实验表明,脉冲门控局部注意力路径是最大贡献者,用确定性top-k掩码替换LIF动力学在匹配稀疏性下导致更大退化,表明时间积分而非稀疏性alone驱动性能。我们还报告了0.8B参数规模化运行,在488亿token上训练,作为优化和稀疏性保持的证据,而非主要质量比较。当前稠密硬件推理慢于GPT-2,因此神经器形部署被呈现为未来的稀疏性驱动机会而非实现的硬件加速。
引用
@article{arxiv.2605.21333,
title = {SymbolicLight V1: Spike-Gated Dual-Path Language Modeling with High Activation Sparsity and Sub-Billion-Scale Pre-Training Evidence},
author = {Ting Liu},
journal= {arXiv preprint arXiv:2605.21333},
year = {2026}
}
备注
35 pages, 5 figures, 25 tables; public code and model artifacts linked in manuscript