混合门控流(HGF):通过选择性低秩校正稳定1.58位大语言模型
机器学习
2026-02-06 v1 人工智能
计算与语言
摘要
大语言模型(LLM)在边缘设备上的部署从根本上受到“内存墙”的限制——这是一种硬件限制,其中内存带宽而非计算成为瓶颈。最近的1.58位量化技术(例如BitNet b1.58)显著减少了内存占用,但与FP16基线相比,通常会导致困惑度下降20-25%。在这项工作中,我们引入了混合门控流(HGF),这是一种双流架构,将1.58位三值骨干网络与由自适应门控制的可学习低秩FP16校正路径相结合。通过在TinyStories数据集上跨越两种训练方案(2500和3500步)的大量实验,我们证明HGF 5.4实现了0.9306的验证损失,而BitNet为1.0294,恢复了纯三值量化与FP16基线(0.8490)之间约55%的质量差距。这种恢复仅需在三值骨干网络之外增加约12-15%的内存开销。此外,我们为一种涌现现象提供了经验证据:量化作为结构化正则化。虽然全精度差分注意力基线(Diff_Only)表现出训练不稳定性,验证损失超过1.68,但三值锚定的HGF在整个训练过程中保持了稳健的收敛。最后,我们报告了将该架构扩展到在SlimPajama和FineWeb-Edu上训练的1.2B和3B参数模型的初步结果。这些更大规模的实验证实,在小规模代理中观察到的架构稳定性和质量恢复可以线性扩展到生产级语言建模领域。
引用
@article{arxiv.2602.05269,
title = {Hybrid Gated Flow (HGF): Stabilizing 1.58-bit LLMs via Selective Low-Rank Correction},
author = {David Alejandro Trejo Pizzo},
journal= {arXiv preprint arXiv:2602.05269},
year = {2026}
}
备注
21 pages, 4 figures, 6 tables. Code and models will be released at opencores.ai