H2LooP Spark预览:面向底层嵌入式系统代码的大型语言模型持续预训练
机器学习
2026-03-16 v2
摘要
大型语言模型(LLM)在通用编程语言中展现出强大的代码生成能力,但在底层嵌入式系统编程等专业领域仍然受限。该领域涉及硬件寄存器操作、供应商特定的SDK、实时操作系统API以及硬件抽象层,这些内容在标准预训练语料库中代表性不足。我们介绍了H2LooP Spark预览,这是一个持续预训练(CPT)流水线,它使用BF16 LoRA和秩稳定缩放,在8块NVIDIA H100 GPU上将OLMo-3-7B(一个完全开放的语言模型)适配到嵌入式系统领域。我们的训练语料库由仓库-数据表对构建而成,涵盖了来自117家制造商的100B token原始嵌入式系统数据,并使用SpecMap(Nipane等人,2026)提出的分层数据表到代码映射方法进行处理。由此产生的精选数据集包含跨越13个嵌入式领域的23.5B token。使用高秩LoRA(r=512)进行持续预训练带来了显著的收益,将领域内困惑度降低了70.4%,将保留仓库的困惑度降低了66.1%。在涵盖13个嵌入式领域的生成式代码补全基准测试中,我们的7B模型在8个类别上的token准确率超过了Claude Opus 4.6和Qwen3-Coder-30B,这表明有针对性的持续预训练使较小的开源权重模型能够在专业的技术任务上与前沿系统相抗衡。我们在Huggingface上以开源工件的形式发布了生产训练检查点。
引用
@article{arxiv.2603.11139,
title = {H2LooP Spark Preview: Continual Pretraining of Large Language Models for Low-Level Embedded Systems Code},
author = {Amit Singh and Vedant Nipane and Pulkit Agrawal and Jatin Kishnani and Sairanjan Mishra},
journal= {arXiv preprint arXiv:2603.11139},
year = {2026}
}